加载中...

统计机器翻译(Statistical Machine Translation,SMT)是通过对大规模双语平行语料进行统计建模来实现翻译的范式,1990 年前后由 IBM 研究组开创,取代基于规则的方法主导机器翻译领域约二十年。
SMT 以噪声信道模型为基础:将翻译视为寻找使「翻译模型概率×语言模型概率」最大的目标句。IBM 模型 1 至 5 解决词对齐问题;此后基于短语的翻译(Phrase-Based SMT)以短语为翻译单元并加入调序模型,成为主流,代表性开源系统为 Moses,谷歌翻译早期也采用此技术。
典型系统包含词对齐(GIZA++)、短语抽取、n-gram 语言模型、调序模型和最小错误率训练(MERT)等模块,以 BLEU 为调优目标。
2014 年后神经机器翻译在质量上全面超越,SMT 逐渐退出主流,但其平行语料建设、评测方法论等遗产仍支撑着今天的翻译研究。

登录 后参与讨论
暂无讨论,来发表第一条评论吧