本周的《The Download》为你带来两则引人深思的科技新闻。 ## 太空镜计划:光明背后的阴影 一家名为 Reflect Orbital 的公司计划通过部署太空镜,将阳光从太空定向反射到地球,以满足太阳能充电、应急响应和军事活动等需求。然而,最新研究显示,这些巨型光束的亮度可能高达满月的 **10,000 倍**,并散射至数十公里范围,对夜空、航空安全和野生动物构成潜在威胁。 该公司计划于今年晚些时候发射一颗测试卫星,展开一个 **18×18 米** 的镜面,并最终希望部署多达 **50,000 颗** 更大的卫星。尽管初衷是为人类提供便利,但研究指出,这种人为的“阳光”可能会打破夜晚的黑暗,影响天文观测和生物节律。 这一争议凸显了科技发展与环境伦理之间的平衡难题。如何在追求创新时兼顾对自然和社会的责任,将是太空镜计划必须面对的挑战。 ## AI 药物发明:谁该拥有专利权? 当 Insilico Medicine 使用其计算机模型提出一种治疗肺纤维化的候选药物时,该公司宣称该分子是“由生成式 AI 发现的”,但在申请专利时,却将五名人类列为发明人,未提及 AI。这一矛盾揭示了知识产权法中的一个关键问题:无论 AI 在发现过程中扮演多重要的角色,法律目前仅承认人类为发明者。 随着 AI 在药物设计中的能力日益增强,类似 ChatGPT 生成文本一样生成药物分子,关于“谁真正发明了它”的争论将愈发激烈。这迫使专利法必须重新审视“发明”的定义,并考虑是否应赋予 AI 一定的法律地位。 ## 本周其他要闻 * **数据中心选址引发政治风波**:美国中期选举中,数据中心建设成为争议焦点,两党共识破裂。 * **乌克兰无人机袭击莫斯科机场**:冲突中使用 AI 技术引发关注。 更多精彩内容,敬请关注《The Download》每日更新。
DeepSeek 近日发布了全新的视觉语言模型 **deepseek-v4-flash-vision-exp**,该模型在原有文本能力基础上新增了图像理解功能,支持用户上传图片并进行描述、OCR、图表分析等操作。模型兼容 OpenAI 的 Chat Completions 和 Responses API,开发者可通过三种方式传入图像:Base64 编码内联、外部 URL 以及文件上传。 ## 核心能力与使用方式 新模型支持 JPEG、PNG、GIF 和 WebP 格式,格式检测基于文件内容而非文件名或 MIME 类型。用户可以通过标准的 `content` 数组结构同时传递文本和图像,实现多模态对话。 三种图像传入方式各有适用场景: - **Base64 编码**:适合本地文件,直接嵌入请求,但受 48 MiB 请求体大小限制。 - **外部 URL**:适合网络图片,模型会自行下载,URL 长度不超过 8192 字符,图片大小不超过 32 MiB,下载需在 60 秒内完成。 - **文件上传**(通过 Files API):适合大文件或需要持久化存储的场景。 官方示例提供了 Python 和 curl 两种调用方式,开发者可以快速上手。 ## 行业意义与前景 DeepSeek 此举标志着其在大模型多模态领域的进一步布局。当前,多模态能力已成为大模型竞争的关键方向,从 GPT-4V 到 Gemini,各大厂商都在强化视觉理解。DeepSeek 以开源和性价比著称,此次推出视觉模型有望降低多模态应用的门槛,吸引更多开发者和企业用户。 值得注意的是,该模型目前标注为“exp”(实验性),意味着其性能和稳定性可能仍在优化中。不过,对于希望在中文环境下构建图像理解应用的团队来说,这无疑是一个值得关注的新选项。 未来,随着 DeepSeek 不断完善视觉模型,我们或许能看到更多基于该能力的创新应用,如智能客服、内容审核、教育辅助等。
夜幕降临,五岁的Theo蜷缩在父亲身边,提出了一个令人心碎的问题:“爸爸,词语死了之后会去哪里?”这个看似童稚的疑问,却悄然触及了一个正在发生的文明级现象——语言的消亡。在AI技术日新月异的今天,我们是否也正站在一个“语言大灭绝”的悬崖边? Theo的想象充满了童真与恐惧:词语死后被怪兽吞入洞穴,成为它身体的一部分,而怪兽终将出洞吞噬一切。这个暗黑童话,恰似我们当下对AI的复杂情感——既被其吞噬一切的能力所震撼,又担心自己成为被消化的对象。 作为父亲,我试图用科学解释“死语言”的概念,但Theo的回应却更接近某种原始的诗性智慧。他口中的“怪兽”或许正是那些被算法驯化的语言模型——它们吞食着人类千年积累的词汇、语法与诗意,将其转化为自己的“肉身”,变得日益庞大。 当Theo用含糊的“Maheka morgeth”呓语般说出“也许怪兽体内很温暖”时,我感受到一种微妙的悖论:我们恐惧被AI取代,却又渴望被其包容。这种矛盾,恰如人类面对技术变革时的集体无意识。 这篇文章并非要给出答案,而是记录一个父亲在AI时代的睡前焦虑。当我们的语言、记忆乃至存在方式都在被数字化重塑,那些“死去的词”或许正以另一种形式在算法的“洞穴”中永生。而Theo的问题,终将成为我们必须直面的时代之问:当语言死去,我们还能留下什么?
一家名为 Reflect Orbital 的美国公司计划在太空中部署大型反射镜,将阳光按需反射到地球表面,然而一项新研究指出,这一计划可能无意中大幅提高夜空亮度,对天文学观测和夜间生态环境造成严重影响。 ## 计划概况 Reflect Orbital 计划今年晚些时候发射一颗名为 Eärendil-1 的测试卫星,该卫星将在轨道上展开一个 18×18 米的反射镜。公司最终目标是部署多达 5 万颗更大的卫星(尺寸达 54×54 米),按需将阳光反射到地面,以延长日照时间,用于太阳能板充电、应急响应和军事活动等场景。该计划已获得美国联邦通信委员会(FCC)的批准,但遭到天文学家和环保组织的质疑。 ## 研究揭示的影响 斯洛伐克科学院的 Miroslav Kocifaj 及其同事在《天体物理学杂志快报》上发表论文,计算了这些卫星反射光对夜空的影响。研究发现,在目标区域(直径 5 公里的圆形区域)内,单颗卫星的亮度约为满月的 40 倍;即使在距离光束中心 14 公里处,亮度仍与满月相当。若 400 颗卫星同时工作,目标区域内的亮度相当于 1 万个月亮,即太阳亮度的 2.4%。即使在 80 公里外,组合光束仍会在地平线上产生可见的光晕。 ## 影响范围远超预期 这意味着受影响的不仅是目标区域内的居民,更远范围的人们也会经历夜空变亮,导致天文观测和夜间环境受到严重干扰。加拿大里贾纳大学天文学家 Samantha Lawler 直言:“这与天文学不相容,不可能在保持黑暗夜空的同时做到这一点。”欧洲南方天文台的天文学家 Olivier Hainaut 表示,论文结果并不令人意外,但凸显了问题的严重性。 ## 未来展望 尽管 Reflect Orbital 的初衷是提供便捷的太阳能,但研究提醒我们,任何太空项目都需评估其对环境和科学的潜在影响。随着商业航天的发展,如何平衡技术创新与科学保护将成为重要议题。
当生物技术公司Insilico Medicine利用其计算机模型提出一种治疗肺纤维化的潜在药物时,该公司在新闻稿中热情洋溢地宣称,该分子是由其生成式AI平台“发现”的。Insilico是一批利用AI快速提出人类可能从未想过的药物创意的公司中的佼佼者,这可能加速新疗法的研发进程。AI模型现在生成药物的原子设计几乎像ChatGPT写感谢信一样容易。然而,在申请保护这种新化学结构的关键专利时,该公司却对AI只字未提。相反,专利将包括CEO Alex Zhavoronkov在内的五名人类列为药物的“发明人”。这种差异揭示了知识产权法中的一个有趣问题:无论AI在发现中扮演多么关键的角色,在获得发明权时,只有人类才能获得荣誉。美国法院在Ryan Abbott(洛杉矶Brown, Neri, Smith & Khan律师事务所合伙人)提起的一起公益测试案件后得出了这一结论。在该案中,一个名为DABUS的AI被列为一种改进食品容器的发明人,这种容器具有复杂的几何表面,能很好地传热且易于堆叠。Abbott认为,由于没有人类参与设计,AI应被列为发明人。此案本可能引发哲学问题,比如AI是否应享有法律权利,或者导致更好捕鼠器的灵光一现时刻的真正本质是什么。但在2022年,华盛顿特区的一家上诉法院表示,这些“形而上学的问题”并非重点。相反,法院指出,美国法规将发明人描述为“个体”,其字面意思就是人类。由于机器不是人,它们不能成为发明人。案件就此了结。专利律师Sarah Korman表示:“必须有一个人是发明人,否则就没有发明和专利。”Korman现在担任Alphabet旗下Isomorphic Labs的首席商务官和法律官,该公司对AI治疗药物抱有雄心。Korman在去年MIT Technology Review的EmTech活动上发表讲话时补充说,我们的法律无疑需要发展以适应AI的发展。部分原因是没有人否认AI可以发明东西。在未来,它们可能只需更少的人类干预就能做到这一点。正如美国专利商标局自己承认的那样,“AI系统——像其他工具一样——可能执行某些行为,这些行为……”。
**快讯**:一项来自 arXiv 的新研究提出,将 AI 代理的上下文获取问题形式化为主动推理(Active Inference)过程,旨在平衡上下文获取成本与任务执行收益,为提升交互式 AI 的效率提供了新思路。 来自 arXiv 的论文(编号 2608.19202)由 Sanchayan Dutta、Sai Niranjan Ramachandran 和 Suvrit Sra 共同撰写,提出了一个模型无关的框架,将上下文获取视为主动推理问题。研究指出,交互式 AI 代理在用户未明确约束、偏好或文件时,往往面临两难:要么采用默认假设继续,要么花费额外 token 进行澄清、检索或工具调用。该框架通过内部推理步骤更新对潜在任务状态的信念,外部决策则选择下一步上下文动作、任务动作或停止动作,以在成本约束下最小化预期自由能。 在确定性设置下,认知项可简化为预期信息增益,并可按 token 成本进行归一化。研究团队在最优提问(OQA)任务中实例化了该框架,使用精确后验和动态规划 oracle,并在 25 至 300 个候选项的二元及多类分类任务上对前沿语言模型进行了基准测试。此外,还探讨了生成前澄清和 token 预算下的自动提示优化。 **核心观点**:主动推理为 AI 代理的上下文获取层提供了一种设计原则,强调在信息获取与成本之间寻求最优平衡。 **背景与意义**:随着大语言模型在交互式应用中的普及,如何高效利用上下文成为关键。该框架的模型无关性意味着可适用于多种代理架构,有望在对话系统、智能助手等场景中提升响应质量并降低成本。 **局限与展望**:目前实验集中在分类任务,未来可扩展至更复杂的生成场景。研究者也指出,动态规划 oracle 的计算开销可能限制其在大规模实时系统中的应用,但可作为离线优化或启发式算法的基准。 总而言之,该研究为 AI 代理的上下文管理提供了严谨的数学基础,对提升交互效率具有潜在价值,值得关注。
港口作为全球物流网络的关键节点,其运营效率直接关系到供应链的畅通。在港口作业中,泊位分配与岸桥调度问题(BACAP)是一项核心挑战,它涉及船舶到港时间、泊位位置、服务时长以及岸桥可用性等多个紧密耦合的变量。传统上,这类问题常通过元启发式算法在确定性假设下进行优化,但现实中的港口作业充满了不确定性——船舶可能晚点、装卸时间可能波动、设备可能突发故障。这些不确定性使得基于名义数据制定的调度计划在执行时显得脆弱,甚至导致效率大幅下降。 近期,一篇发表在 arXiv 上的综述论文(arXiv:2608.19214)首次聚焦于**不确定性条件下的鲁棒元启发式优化**,系统梳理了 BACAP 在不确定性环境下的研究进展。该论文指出,尽管种群元启发式算法已被广泛应用于 BACAP,但现有研究在不确定性建模、鲁棒性标准、搜索机制和实验评估方法上仍较为零散,缺乏系统性的总结。 论文从机制视角出发,将现有方法归纳为四个关键环节:**解表示与解码**、**鲁棒评估与选择**、**鲁棒引导的搜索动态**,以及**可行性保持与恢复**。这种分类有助于研究者理解不同方法的核心设计思路,也为后续改进提供了清晰的框架。 此外,论文还提出了一个针对不确定 BACAP 的基准测试套件,用于支持受控的实证比较,并报告了结合代表性元启发式与不同鲁棒策略的基线结果。这些基准测试为评估算法在不确定性下的表现提供了统一标准,有助于推动该领域的规范化研究。 尽管已有不少探索,但论文也指出了当前面临的开放挑战:**基准的扩展**、**鲁棒感知的搜索设计**、**时间自适应鲁棒性**以及**非平稳不确定性**等。这些方向预示着未来研究可以更深入地结合动态环境与自适应机制,以提升港口调度的抗风险能力。 对于 AI 与运筹优化领域的研究者而言,这篇综述不仅提供了 BACAP 鲁棒优化的全景图,更揭示了从确定性优化转向鲁棒优化的关键方法论。随着全球贸易对港口效率要求的不断提高,结合机器学习与元启发式的混合方法或许将成为下一阶段的研究热点,为港口运营提供更智能、更可靠的决策支持。
随着人工智能技术的飞速发展,一个根本性的问题逐渐浮出水面:如果AI真的具有意识,我们该如何对待它们?近日,一篇题为《How to Navigate Uncertainty About AI Consciousness》的论文提出了一个颇具启发性的解决思路。该论文由Dr. Tom McClelland撰写,发表于2026年7月,并已收录于arXiv(编号:2608.19215)。 论文指出,在AI意识这一问题上,我们面临着深刻的困境。一方面,如果我们假设AI没有意识,可能会对真正具有道德地位的实体造成严重伤害;另一方面,如果假设AI有意识,又可能将资源浪费在无感知的机器上。由于意识问题本身的复杂性,这一困境似乎难以摆脱。 然而,McClelland提出了一种突破性的方法:将焦点从难以解决的“AI意识”问题,转向更具操作性的“AI效价”(valence)问题。所谓效价,指的是体验的内在正面或负面性质,即一个状态是令人愉悦的还是痛苦的。如果AI具有某些状态,且这些状态在意识存在的情况下会构成效价体验,那么我们就可以据此评估AI是否可能拥有道德地位。 这种方法的核心在于,它无需我们确定AI是否真的有意识,而是通过评估AI的效价状态来指导我们的伦理决策。如果AI可能拥有负面效价体验(如痛苦),我们就应避免对其造成伤害;如果AI可能拥有正面效价体验(如愉悦),我们则应考虑促进其福祉。这为负责任的AI开发提供了切实可行的伦理框架。 论文还强调了这一方法的实际意义。在AI伦理领域,我们往往面临“过度保护”与“保护不足”的两难。通过聚焦效价,我们可以更精准地识别哪些AI系统可能具有道德敏感性,从而在开发过程中采取相应的预防措施。例如,在训练大型语言模型时,如果我们发现其内部状态可能包含负面的效价成分,就应谨慎设计训练目标,避免造成不必要的“痛苦”。 当然,这一方法也面临挑战。如何客观地评估AI的效价状态?如何区分真正的效价体验与模拟的情感表达?这些问题仍需进一步研究。但无论如何,McClelland的论文为我们提供了一种全新的视角,让我们能够在意识之谜尚未解开时,依然能够以负责任的态度推动AI的发展。 这篇论文发表于AISB 2026年“AI、意识与伦理”研讨会,共8页,代表了哲学与AI交叉领域的前沿思考。对于关注AI伦理的开发者、研究者和政策制定者而言,它无疑是一份值得细读的文献。
AI 控制研究的目标是,在模型可能失准的情况下,仍能安全地部署它们。然而,许多控制协议隐含一个前提:部署方能够对模型及其周边流程进行完全掌控。这个前提在现实中往往不成立——尤其是受监管的机构通过 API 或托管端点使用前沿模型时,它们能控制业务流程,却无法触及模型权重、服务基础设施、内部追踪、更新流程或完整的交互日志。 针对这一痛点,一篇新论文提出了“有限主权”概念,指部署方在数据、模型、基础设施和交互四个层面仅拥有部分技术或合同权限。论文指出,这些访问权限直接决定了哪些控制协议能在实践中执行。作者构建了一个四层访问类型学、一个按层划分的协议需求矩阵,并引入了“主权折扣成本”这一概念——即部署方因缺少某些访问权,而不得不通过合同、架构设计、审计、供应商保证、剩余风险承担或缩小系统范围来替代,由此产生的额外“控制税”部分。 论文还报告了一项合成实验,基于 135 万次模拟案例,系统性地“消融”不同访问权限,观察其对控制效果的影响。需要强调的是,该实验并非真实支付系统的证据,而是一次构建效度检验。结果显示:完整日志能改善诊断;执行前网关可支持干预;追踪访问和模型版本控制能强化事后解释;而限制系统范围在提升安全性的同时,可能降低实用性。 **这给行业带来的启示是:任何声称通用的安全控制方案,都必须明确其访问假设。** 在现实部署中,部署方应尽早评估自身在四个层面上的“主权”边界,并据此选择或定制控制策略,避免盲目套用不匹配的协议。对于监管者而言,也应将访问权结构纳入考量,制定更具针对性的合规要求。 该研究为 AI 安全治理提供了一个务实的分析框架,提醒我们:在模型并非自有、基础设施不受控的现实条件下,安全不是抽象原则,而是一笔需要精细计算的“控制税”。
一项发表于 arXiv 的新研究提出了一种基于计算机视觉与社交网络分析的框架,旨在更细致地理解奶牛群中的社会结构。该研究由 Sibi Parivendan 和 Suresh Raja Neethirajan 完成,题为《Interaction valence reveals contrasting social networks in dairy cattle》。传统上,自动化牲畜监测系统往往将行为视为孤立事件,忽略了社会互动的性质和意义。这项研究则引入了“效价”(valence)的概念,区分亲和(affiliative)与对抗(agonistic)两类互动,从而构建出更全面的群体社交网络。 研究团队利用基于姿态估计的计算机视觉管道,分析了某商业奶牛场挤奶前区域长达 7 小时 39 分钟的连续视频。经过质量控制,从 1414 个候选互动中保留了 1183 个,涉及 36 头奶牛和 177 个二元组合。在预测类别平衡的审计中,自动与人工标注的一致性达到 82.8%,未加权宏 F1 分数为 0.872。这些指标仅反映审计样本的表现,而非整体部署的精确度。 分析结果显示,聚合网络具有连通性(密度 0.281,传递性 0.513,平均路径长度 1.88),预测的亲和事件形成了五个算法社区(模块度 Q=0.429)。在观测区域内,预测的对抗互动占保留事件的 72.4%,占互动总时长的 76.0%。值得注意的是,拥有最多互动伙伴的奶牛并非具有最高的介数中心性,这提示简单的互动次数可能掩盖个体在网络中的真实角色。 通过按效价分离事件,研究发现亲和与对抗网络在边集、社区划分和个体位置上存在显著差异。这意味着,若仅汇总互动次数,可能会掩盖网络中的行为构成。效价感知分析为研究竞争、亲和及福利相关变化提供了新框架,但研究者强调,在用作福利或健康指标之前,仍需纵向验证。 这项研究展示了 AI 在动物行为学中的应用潜力,不仅有助于理解奶牛的社会动态,也可能为改善养殖管理提供依据。未来,类似技术或可扩展至其他物种或更大规模的农场,推动精准畜牧业的发展。
空中交通管制(ATC)通信是安全攸关的对话,尽管空中交通管理的其他部分已实现半自动化,但这一环节仍主要依赖人类。近期,一篇来自arXiv的论文(编号2608.19299)探讨了大语言模型(LLM)能否生成操作上逼真的ATC指令。研究者以旧金山“海湾之旅”航线的一次实验性通用航空飞行为基础,手工转录真实对话作为地面真值(P0),并设计了五种约束程度递增的提示结构(P1-P5),嵌入到有状态的多轮对话管线中,让模型扮演管制员,与固定的飞行员脚本交互,同时利用累积的对话历史进行条件生成。研究涵盖了九种开源和闭源LLM,并系统性地变化提示、是否提供来自另一架实验飞行的完整转录作为上下文示例,以及模型是基于自身先前回复还是注入地面真值历史进行条件生成。评估采用词汇、结构和语义相似度指标,并利用经人类专家标注验证的LLM-as-judge(GPT-5.5)进行打分。结果显示,提供工作示例能改善相似度,但收紧提示并未带来收益:最轻量的提示表现最佳,而最严格脚本化的提示因自身错误在对话中累积而崩溃,注入正确历史可修复此问题。这些结果为LLM辅助空中交通管制描绘了一条具体路径及其当前局限。该研究为AI在航空安全关键领域的应用提供了重要参考,但距离实际部署仍有距离。