加载中...

t-SNE(t-distributed Stochastic Neighbor Embedding,t 分布随机邻域嵌入)由 Laurens van der Maaten 与 Geoffrey Hinton 于 2008 年提出,是一种专为可视化设计的非线性降维算法,通常把高维数据映射到二维或三维。
算法在高维空间用高斯分布把样本间距离转化为条件概率(相似度),在低维空间用自由度为 1 的 t 分布建模相似度,再最小化两个分布间的 KL 散度。t 分布的重尾特性缓解了低维空间的"拥挤问题",使不同簇彼此推开、局部结构清晰。困惑度(perplexity)是控制邻域规模的关键超参数。
广泛用于词向量、单细胞测序、深度网络中间表示等高维数据的探索性可视化。
计算复杂度高、结果随随机种子变化;簇间距离与簇大小不具备定量含义,不适合作为下游任务的通用降维;近年 UMAP 在速度上形成有力竞争。

登录 后参与讨论
暂无讨论,来发表第一条评论吧