加载中...

困惑度(Perplexity,常缩写为 PPL)是评价语言模型质量的经典指标,定义为模型在测试文本上平均交叉熵损失的指数。直观含义是:模型在每个位置上「犹豫」的等效选项数,数值越低说明模型对真实文本分配的概率越高、预测能力越强。
对一段词元序列,将模型给出的每个词元的负对数概率取平均,再做指数运算即得困惑度。它与交叉熵一一对应,只是尺度更直观:困惑度为 10 相当于每步在 10 个等可能选项中猜测。
困惑度是语言模型预训练过程中最核心的监控指标,扩展法则(Scaling Law)研究即以损失或困惑度刻画模型随规模的改进;评测集如 WikiText-103 长期以困惑度作为标准指标。
困惑度依赖分词方式与评测语料,不同词表的模型之间不可直接比较;它衡量的是拟合语言分布的能力,与指令遵循、事实准确性等下游表现并不完全一致,因此需与任务评测结合使用。

登录 后参与讨论
暂无讨论,来发表第一条评论吧