SheepNav
精选今天0 投票

对比学习中的语义几何:锚点散度让相似度随语境而变

相似度不该只有一把尺子

在向量检索和表示学习中,余弦相似度几乎是默认的度量方式。它简洁、稳定,却隐含了一个强假设:语义相似性只有一种固定的几何结构。

但现实并非如此。两幅图像可能因为描绘同一物体而相似,也可能因为视觉风格一致而相似,还可能因为指向同一临床发现而相似。这三种「相似」指向完全不同的语义维度,用同一把尺子去衡量,必然产生混淆。

来自 Akash Kannan、Kiho Park 与 Victor Veitch 的论文《Anchor Divergence for Semantic Geometry in Contrastive Learning》(arXiv:2610.06919)正是针对这一矛盾展开研究。

核心思路:把几何当成可建模的对象

论文的关键洞察是:对比学习得到的表示,其实天然包含了一族几何结构,而非只有单一几何。作者借助三个工具建立联系:

  • 对比学习:提供表示空间的训练框架;
  • 指数族分布:刻画锚点(anchor)上的概率分布;
  • 信息几何:提供 Bregman 几何这一更一般的度量家族。

由此,作者建立了「锚点上的概率分布」与「表示空间上的 Bregman 几何」之间的对应关系。换句话说,对锚点分布建模,就等于对几何本身建模。

Anchor Divergences:在固定表示上切换语义视角

基于这一对应,作者提出了 Anchor Divergences(锚点散度)。它的价值在于:

  1. 表示保持固定——不需要为每种语义重新训练模型;
  2. 语境可指定——通过调整锚点分布,就能定义面向特定语义结构的度量;
  3. 高效——检索实验中,该方法被验证为指定语境相关语义相似性的有效且高效手段。

这意味着同一个预训练表示,可以在「同物体」「同风格」「同临床发现」等不同任务间灵活切换,而无需重复训练成本。

为什么值得关注

这项工作把「相似度度量」从固定超参数提升为可学习、可条件化的对象。对于多模态检索、医疗影像检索、推荐系统等需要区分多种相似性来源的场景,提供了一条理论清晰、实现成本可控的路径。

论文代码已公开,属于 cs.AI,同时交叉 计算机视觉、机器学习 与 统计机器学习 领域,值得关注表示学习与检索方向的研究者跟进。

延伸阅读

  1. Anthropic 发布 Claude Haiku 5.5:史上最便宜、最快的小模型,成本直降 75%
  2. 今日速递:减肥药或能延缓衰老,二氧化碳电池储能新突破
  3. OpenAI 为青少年推出大学规划工具,并组建青少年 AI 顾问委员会
查看原文