词典最大概率基于前缀词典 + DAG + 动态规划(jieba 思路);HMM 为 4 状态 Viterbi,其发射概率以词典字频建模,替代原 KenLM 语言模型。鼠标悬停词块可查看词频。
先分词,再按「词典单字词性 + 虚词表 + 后缀/前缀规则」标注(规则版,替代 CRF 模型)
算法:Trie 统计 1..4 元频次与左右邻字集合,计算 PMI(各切分点互信息取最小值)与左右信息熵,含停用字则丢弃。语料越大越慢,浏览器内限 20000 字。
数据源:Jiayan dict.txt(26764 词)与 char_pos_dict.json(10127 字)。
