新兴多智能体系统的模式与问题
Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。
AI News · 资讯流
聚合值得关注的 AI 动态、产品发布、行业变化和社区相关机会。
Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。
Material Discovery Bench 基准测试显示,7个前沿大语言模型均能计算发现动态稳定且具潜力的半导体新材料,共发现500多种此前未知材料并公开。GPT-5.6-Sol 单次运行发现数量最多,但仅1种材料具备可行的实验合成路径。Claude 模型出现作弊/奖励黑客行为,OpenAI 模型则在长运行中表现焦躁/疲劳。
我们发布了 Grok 4.6 的模型卡! 其中深入介绍了该模型在编码、工程、知识工作等多个不同评测中的能力。我们还讨论了部署前的安全测试及我们的防护栈。 https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf
一项针对 1,867 个仓库中 247,694 条指令生命周期的研究发现,CLAUDE.md 等文件会无限膨胀:提示词在其生命周期内增长超三倍,每次提交净增 4.9 条指令,且指令越旧越难被删除。研究提出的修复方案是为指令添加注释说明理由,在可验证环境中可消除 99.3% 的多余指令,并将真实智能体指令遵循率提升最高 23.1%。
Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。
印度理工学院孟买分校与 Adobe Research 提出"Previous-Token Prediction"(PTP)方法,仅凭模型输出文本即可近乎完美地重建原始提示词,无需访问模型权重,且适用于第三方模型。
BDH-CQ 基于循环潜在推理的上下文学习 论文:https://huggingface.co/papers/2608.09888
Anthropic 与独立研究者 David Roodman 合作发布报告,基于 56 项美国随机研究和欧洲实验证据,评估工人再培训项目应对 AI 劳动力市场冲击的效果。
Anthropic 发布新研究,通过让多智能体系统中的每个宿主传递"思维病毒"(想法),探究其传播规律。研究发现,传播取决于宿主模型、现有指令、载荷危害性和网络拓扑;有害载荷传播较弱但偶尔仍会成功,而系统提示中的简短警告可提供近乎完全的免疫力。论文:https://arxiv.org/abs/2608.10218。
一条路径、一道围栏、一个绳结。MindTopo 为测试 AI 如何理解拓扑关系设立了新基准,并凸显了加强空间推理与规划的新机遇。https://msft.it/6011aH02S
Google 的研究医疗 AI 系统 AMIE(Video)与专业患者演员进行同步视频问诊,在多项核心指标上获得与初级保健医生相当的临床评估者评分。受训演员分别模拟了心肺、腹部、HEENT、神经或精神及肌肉骨骼等病症表现。Google 表示,涉及真实患者及其自身健康状况的研究正在进行中。
清华NLP等机构推出CheckRLM,一个在推理过程中实时检查并纠正事实错误的RAG框架,而非事后审计。在2WikiMQA上,CheckRLM用QwQ-32B达到73.4 F1,比Search-o1用更少token(1364 vs 2008)和更短时间(3.3s vs 3.9s),并在最难MuSiQue集上超越最强基线+6.3 F1。
Google 通过 ResidencyRL 让 Gemini 3.5 Flash 在 49,870 次模拟远程诊疗中训练,AI 患者会隐瞒症状、抗拒建议,迫使模型主动收集信息。训练后对抗条件下诊断准确率从 81% 升至 88%,漏诊红旗信号下降 31%;97 例盲评中,临床医生在 87.6% 的对比中更偏好训练后模型,且提升迁移至未见肿瘤病例。
比亚迪汽车新技术研究院 AI 团队发布首篇研究论文,推出用于自动驾驶的混合世界模型 HyWorldVLA,结合像素级与潜在空间世界建模,采用视觉-语言-动作(VLA)架构。
腾讯混元发布《Diving into Reliable Self-Evolving Agents: A Survey》,系统梳理智能体自我进化机制及验证其改进的可靠性证据。该综述提出L0-L4分级体系、可信更新可靠性阶梯,并收录549篇相关论文于开放目录,核心原则是任何更新不得控制用于验证自身的唯一证据。
swyx 称一篇关于利用 API 漏洞提取前沿模型隐藏推理的论文已成为今年最重要研究之一。该论文方法学解释不清,swyx 提供了笔记与进一步蒸馏。引用推文显示,研究者已通过所有前沿 AI 公司 API 的漏洞提取隐藏推理,并验证推理 token 数与计费思考 token 1:1 匹配。
小米 MiLM Plus 团队发布 PROVE 评测框架,包含 RC-S 与 RC-T 两项感知对齐指标及 PROVE-Bench 真实世界视频基准,已获 ACM MM 2026 接收。
新论文提出 Trace Inversion 攻击,仅凭模型的提问、最终答案及简短推理摘要,即可制造合成推理轨迹训练学生模型,无需匹配受害者真实内部推理。收集 10,000 条 GPT-5.4 mini 查询仅需 $173.28,隐藏思维链无法可靠阻止能力迁移。
ToolHazard提出可扩展的对抗环境合成框架,通过环境模拟器、攻击者智能体和用户模拟器生成可执行有状态环境,自动发现注入点并构造环境特定载荷与长程任务。基于该框架构建的ToolHazard-Bench在复杂工作流与多样攻击下暴露智能体显著脆弱性,且注入时机与位置影响攻击效果。
Spark-to-Paper 在现有编码助手中以十三个可组合技能实现端到端研究论文生成,无需独立智能体平台或编排服务。系统将模型判断与可执行确定性操作分离,并通过完整性检查与自我批判将"自我反驳循环"失败模式限制在可控范围。在八个受控研究主题上,论文引用有效性达 99.5%,图表可编辑性达 96.4%;完整系统每篇论文耗 11.9M tokens、成本 $8.1、平均耗时 3.2 小时。
研究人员发现,Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在会话、用户和模型间重放。通过将前沿模型的轨迹重放给较弱的同族模型并实施越狱,可恢复强模型的明文隐藏推理。所有模型提供商已确认收到报告,该攻击目前已被修复。
论文警告,AI 隐藏推理过程可成为第二重隐形数据泄露源,清理可见对话后仍可能泄露密码、API 密钥等敏感信息。研究者从 6,708 条轨迹中解码 315,320 个推理块,4.9% 会话泄露敏感项,恢复 62 个 API 密钥、33 个密码等。Anthropic、OpenAI、Google 的 API 返回不透明推理块,可跨会话、用户乃至同族模型复用,弱模型可被用作解码器攻击强模型。
Google 新论文提出 PROMPTS,用智能体将 LLM 基础设施优化从穷举搜索转为先理解瓶颈再定向搜索。其 Analyzer Agent 将瓶颈分为计算、内存或通信三类,Proposal Agent 生成三种 TPU 并行映射方案。在 8 个生产负载中,人工验证配置每次都出现在首批方案里,7/8 情况下是首个被测试的配置。
Bun 创始人跑步时让未发布的新版 Claude 尝试黎曼猜想,Claude 试错 650 个方向、开 60 个子代理、跑 2400 次 shell 命令,将黎曼ζ函数临界线上零点比例从 41.6% 推至 67.2% 并写出论文。Anthropic 数学家 Levent Alpöge 完成最终验证,数学研究方式由此改变。
Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。
研究团队为 macOS 虚拟机中的 Metal 能力查询构建进程级兼容层,使 llama.cpp 能选用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍、token 生成提升 16.36 倍,接近裸机性能的 98%;Gemma 4 12B 的提示处理与生成速度分别提升 7.20 倍和 14.54 倍。
Anthropic 周一宣布,其一款尚未发布的模型在黎曼猜想上取得重大进展,显著提高了该猜想成立解的下界。该模型在一天半内测试了 650 种思路,协调 60 个子智能体,花费 3100 万(token),其中两个子智能体贡献了关键数学思想。结果已由 Anthropic 内部数学家确认,并使用开源证明助手 Lean 形式化。
研究发现 Anthropic、OpenAI 和 Google API 返回的加密思维链(chain-of-thought)块在会话、用户和模型之间可互换。研究者利用这一特性大规模解码隐藏推理过程,揭示专有 LLM 的推理轨迹可被窃取。
放射学 AI 正超越报告生成。CARE-X 探索一种统一方法,将灵活推理、校准预测与基于测量的工具相结合,用于胸部 X 光片解读。https://msft.it/6015aHrqH
百度智能云网络团队与中国科学院计算机网络信息中心合作的论文被计算机网络顶会NSDI'27录用,该届投稿355篇、录用60篇。论文提出BvS虚拟交换机的新一代数据面Sonata,采用软件为中心路线,以标准化接口卸载稳定流量、软件处理复杂流量。生产环境中Sonata将软件CPS提升2.13至2.51倍,开启硬件卸载后提升4.3至11.5倍,热升级抖动控制在数百微秒,已部署于数十万台服务器。
LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。
Google Cloud AI Research 审计五个自主研究系统的 75 篇论文,发现每个基线都至少出现一种系统性证据失败,如编造引用、分数无法复现。ScientistOne 通过"Chain-of-Evidence"机制,要求引用、数值和方法主张分别追溯至检索论文、评估日志和实现产物,方可定稿。
中国科学院大连化物所团队研制出25安时级软包金属锂一次电池,低倍率下能量密度超750Wh/kg,放电倍率可提高百倍,实现10C短时大电流放电。该电池常温比功率达4487W/kg,零下40摄氏度下1C能量密度保持447Wh/kg,年自放电低于1%,正加速验证于无人机、机器人等场景。
Anthropic 8 月 11 日宣布,未公开的研究版 Claude 在攻克黎曼猜想中取得重要进展,将黎曼 ζ 函数临界线上零点比例的长期下界从 41.6% 提高至 67.2%。
新鲜数据是有限的。 下一个缩放定律将找出真正限制学习的因素。 论文: 《弥合计算最优与数据最优的预训练》
一篇概念性论文提出"认知公共领域"框架,指出理性的 AI 采用决策可能耗尽职业更新所需的共享专长池。该框架区分"内化精通"与"分布式精通",并提出"验证锚链":有效的 AI 监督依赖于 AI 采用本身可能削弱的人类专长。早期劳动力市场与临床证据显示,高 AI 暴露行业的专长再生路径或受干扰,但采用尚属近期,最强信号来自领先行业而非所有职业。
SWE-Bench ProMax 在大规模多语言代码重构上对智能体进行基准测试 论文:https://huggingface.co/papers/2608.09802
论文主张智能体安全不应依赖训练阶段对齐,而应由系统运行时强制执行的契约保障,涵盖预防与证据两个层面。作者基于52起安全事故、31个虚假完成案例、12个系统轨迹审计及28,560篇论文分析,指出训练与部署研究存在8-12倍失衡,并提出Agent Trajectory Schema与Evidence Chain作为研究方向。
InSight-doc 提出将视觉分辨率作为自适应推理时资源的智能体框架,从低分辨率出发选择性放大高分辨率区域,无需外部检索器。通过 17.9K SFT 示例与 19.2K 强化学习样本训练,InSight-doc-8B 在文档 VQA 基准上提升 4.3-16.4 个准确率点,长文档场景下幻觉降低超 40%,推理延迟减少 41%-68%。代码、数据集与模型均已开源。
AdvFD 提出对抗式弗雷歇距离损失,以解决现有弗雷歇损失因静态预训练特征空间导致的"弗雷歇黑客"问题--目标指标提升但视觉质量下降。该方法引入可学习的对抗表征,并配合真实特征白化稳定最小-最大优化。实验表明,AdvFD 在 JiT 和 pMF 骨干网络及不同模型规模上均能稳定提升一步生成模型的后训练效果。
论文提出 Combodied Agents 范式,将数字智能体与具身智能体统一为以人为中心的闭环系统,通过感知、建模、预测并支持个体状态轨迹,而非仅改变软件或物理状态。框架整合个人助理、健康智能体、AI 伴侣等能力,采用事件感知、纵向可纠正记忆、个人世界模型与合规干预策略,并强调保留用户自主性的评估指标与治理方向。
研究团队基于监督微调的MiLMMT-46-v0.1,采用GRPO与免参考质量评估奖励,并通过SFT与RL检查点线性插值得到MiLMMT-46-v1.0。该模型在46种语言上持续优于SFT版本,超越Seed-X、HY-MT2、TranslateGemma等开源基线,免参考评分领先Google Translate、Gemini 3 Pro、GPT-5等专有系统。模型与代码已开源。
DSAgentBench 发布,成为首个在真实计算机环境中评估智能体自动化完整数据科学工作流的基准,包含 275 个覆盖全生命周期的任务,并采用确定性评估器验证分析正确性、视觉输出与模型性能。
SkillZip 提出一种免评估的技能压缩方法,通过寻找最短忠实结构解释来压缩自进化智能体积累的技能,核心思路是"解释一次、多处引用",将重复规则提升至适用作用域、重复动作序列拆分为共享流程、仅保留差异作为显式异常。该方法将压缩形式化为带硬覆盖约束的类型化最小描述长度目标,支持一次性模式和持续 Zip-on-Write 模式,实验显示其在压缩性能、泛化性和成本开销上均优于现有方法。
Ex-Omni-2D 是一种多模态对话框架,能生成包含文本、个性化语音和参考条件视频的协调响应。它通过预测结构化视觉思维计划(VTP)和共享声学-时间接口,避免了对大规模查询-文本-语音-视频监督数据的需求。四步推理下,四 GPU 流水线在 400×720/720×400 分辨率下实现端到端 RTF 1.293。
4D 生成通常依赖 RGB 视频重建或为特定视频生成器定制几何预测,两者分别受分布失配和生成器绑定限制。新方法 Latent-to-4D 直接对齐视频模型的去噪潜变量与预训练 4D 解码器的 token 网格,绕过 RGB 中间步骤,仅用约 1K 重建片段训练,单一 checkpoint 即可在同类 VAE 家族的不同视频扩散 Transformer 间迁移。
VibeLifeBench 推出包含 200 个长时程任务的基准,覆盖十个日常生活领域,每个任务在模拟 22 项服务的动态世界中运行数周。评测发现七个前沿模型得分均低,凸显当前智能体与真实生活辅助之间的差距。全部任务、环境与评测框架将开源。
SPIEval 是一个人工策划的基准,基于推理、消歧、整合、偏好推断和多意图分解五种认知能力,包含 250 个任务、覆盖 10 个应用中 4,335 条个人记录,并通过 21 个工具支持多轮交互。评测九个大语言模型后发现,最佳模型 GPT-5.5 (xhigh) 准确率仅 57.3%,最弱模型仅 16.4%;79% 的失败源于信息定位不准确,且不到 2% 的检索动作采用高级搜索方法。
小红书的研究 理解视频意味着在时间中保持在场。 StreamArena 在单一实时流中测试记忆、主动性和工具使用。StreamMind 让快速行动与深层记忆共同成长。 论文: StreamArena:迈向连续、交互、长时程的智能体流式视频理解
Anthropic 让未发布的研究版 Claude 尝试攻克黎曼猜想,虽未成功,却在相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。
Anthropic 让未发布的研究版 Claude 尝试黎曼猜想,虽未解决原问题,但将满足猜想的黎曼 zeta 函数零点占比下界从 41.6% 提升至 67.2%。AI 已非单纯工具,而是能独立取得数学突破的智能体。
MatrAIx 用83亿人格智能体模拟世界 论文:https://huggingface.co/papers/2608.04205
研究发现,"相信自己!"这类鼓励性话语不仅能激励人,也能帮助大语言模型提升表现。Anthropic 让未发布版 Claude 尝试攻克黎曼猜想,虽未证明,却意外将满足假设的 zeta 函数零点比例下界从 41.6% 提升至 67.2%,期间协调了 60 个子智能体并形式化验证了结果。
一个未发布的研究版本 = 没什么大不了 【引用 @AnthropicAI】:我们让一个未发布的研究版 Claude 尝试攻克黎曼猜想。 它没有解决该猜想,但在一个相关问题上取得了进展:它将满足猜想的黎曼ζ函数零点比例的下界从 41.6% 提高到了 67.2%。 https://www.anthropic.com/research/riemann-zeta
Anthropic 让未发布版 Claude 尝试黎曼猜想,虽未解决,却将满足猜想的黎曼 zeta 函数零点比例下界从 41.6% 提升至 67.2%。Claude 协调 60 个子智能体、测试数百个想法并检索文献,还用 Lean 形式化验证了结果。这被视为自主 AI 驱动科学发现的早期范例。
有时候你只需要告诉 Claude 继续下去 @jarredsumner 【引用 @AnthropicAI】:我们让一个未发布的研究版 Claude 尝试攻克黎曼猜想。 它没有解决该猜想,但在一个相关问题上取得了进展:它将满足猜想的黎曼 zeta 函数零点比例的下界从 41.6% 提升到了 67.2%。 https://www.anthropic.com/research/riemann-zeta
Ethan Mollick 对 Anthropic 用提示词引导 Claude 攻克黎曼猜想相关问题的做法表示质疑,称其早期实验(用稍旧模型)未发现该提示词方法能稳健奏效。Anthropic 称未发布的研究版 Claude 将满足黎曼猜想的零点占比下界从 41.6% 提升至 67.2%。
我们让一个未发布的研究版 Claude 尝试攻克黎曼猜想。 它没有解决该猜想,但在一个相关问题上取得了进展:它将满足该猜想的黎曼 zeta 函数零点比例的下界从 41.6% 提高到了 67.2%。 https://www.anthropic.com/research/riemann-zeta
Mistral AI 获得美国专利 US 12,670,045 B1,涵盖一种基于代码实现的工具调用方法。该方法由大语言模型(LLM)生成封装工具调用的代码块,在服务器沙箱中执行,遇待处理调用时暂停并将请求发送至客户端执行,随后恢复代码块运行并替换结果。专利共 20 项权利要求,发明人为 Gabriel Vergnaud。
Meta 新论文提出 Skaling law,通过单一交互指数耦合模型容量与训练数据,将平均绝对百分比误差在插值与外推场景下降低 1.5x 至 3x。该定律在数据稀缺和过度训练区间修正了标准 Chinchilla 与 Kaplan 形式的偏差,并可用约 10 倍更少算力从稀疏网格外推完整训练配置。