精选今天0 投票
对比学习中的语义几何:锚点散度让相似度随语境而变
相似度不该只有一把尺子
在向量检索和表示学习中,余弦相似度几乎是默认的度量方式。它简洁、稳定,却隐含了一个强假设:语义相似性只有一种固定的几何结构。
但现实并非如此。两幅图像可能因为描绘同一物体而相似,也可能因为视觉风格一致而相似,还可能因为指向同一临床发现而相似。这三种「相似」指向完全不同的语义维度,用同一把尺子去衡量,必然产生混淆。
来自 Akash Kannan、Kiho Park 与 Victor Veitch 的论文《Anchor Divergence for Semantic Geometry in Contrastive Learning》(arXiv:2610.06919)正是针对这一矛盾展开研究。
核心思路:把几何当成可建模的对象
论文的关键洞察是:对比学习得到的表示,其实天然包含了一族几何结构,而非只有单一几何。作者借助三个工具建立联系:
- 对比学习:提供表示空间的训练框架;
- 指数族分布:刻画锚点(anchor)上的概率分布;
- 信息几何:提供 Bregman 几何这一更一般的度量家族。
由此,作者建立了「锚点上的概率分布」与「表示空间上的 Bregman 几何」之间的对应关系。换句话说,对锚点分布建模,就等于对几何本身建模。
Anchor Divergences:在固定表示上切换语义视角
基于这一对应,作者提出了 Anchor Divergences(锚点散度)。它的价值在于:
- 表示保持固定——不需要为每种语义重新训练模型;
- 语境可指定——通过调整锚点分布,就能定义面向特定语义结构的度量;
- 高效——检索实验中,该方法被验证为指定语境相关语义相似性的有效且高效手段。
这意味着同一个预训练表示,可以在「同物体」「同风格」「同临床发现」等不同任务间灵活切换,而无需重复训练成本。
为什么值得关注
这项工作把「相似度度量」从固定超参数提升为可学习、可条件化的对象。对于多模态检索、医疗影像检索、推荐系统等需要区分多种相似性来源的场景,提供了一条理论清晰、实现成本可控的路径。
论文代码已公开,属于 cs.AI,同时交叉 计算机视觉、机器学习 与 统计机器学习 领域,值得关注表示学习与检索方向的研究者跟进。
