加载中...
| 类别 | 计算理论 |
| 领域 | 计算机科学 |
信息熵是信息论中用以度量随机变量不确定性的量,由香农引入。直观上,一个事件越不可预测、可能结果越多且越均匀,其信息熵就越大;若结果确定无疑,则熵为零。熵的常用单位是比特,对应以二为底的对数。
对于一个离散信源,信息熵等于各结果出现概率与其自信息乘积之和的相反数,即概率乘以该概率以二为底对数的负值再求和。当所有结果等概率时熵达到最大;概率分布越集中,熵越小。熵也可理解为对信源进行最优编码时每个符号平均所需的最少比特数,这正是无损压缩的理论极限。
信息熵的应用极为广泛。在数据压缩中,它给出码长下界,霍夫曼编码和算术编码都力图逼近这一极限。在机器学习中,交叉熵常用作分类模型的损失函数,决策树则用信息增益挑选划分特征。此外,熵还用于密码强度评估、特征选择和异常检测,是衡量信息量与混乱程度的通用尺度。
| 类别 | 计算理论 |
| 领域 | 计算机科学 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧