蓝十字蓝盾协会分析:美国医院用 AI 写病历,两年推高医疗支出 9.42 亿美元
蓝十字蓝盾协会(BCBSA)的分析显示,美国医院在提交保险理赔单据时使用 AI 工具,两年里使医疗支出额外增加 9.42 亿美元。
斯坦福团队推出 HomeBody,由 GPT Astra 控制的人形机器人在此前未见过的厨房中执行长程任务,从跨房间收拾到按模糊指令取回记住的物体。整个过程无需环境专属训练数据或额外的策略学习,项目页面为 https://tml.stanford.edu/homebody/。Ethan Mollick 转发并评论称,LLM 出人意料地成为许多看似与人类语言模型无关问题的关键。
DeepSeek-AI 发布技术报告,介绍用于大规模 LLM 智能体 RL 训练与评估的生产级沙箱平台 DeepSeek Elastic Compute(DSec),统一提供 FnCall、容器、microVM 和完整 VM 四种后端。
一项覆盖3132名参与者、共五个实验的研究发现,仅当AI建议可用时,人们放弃回答的比例从36-44%骤降至3-6%。由于所用模型Step 3.5 Flash对所测试的电影视觉细节问题几乎全错,参与者正确率反而从27.5%降至9.2%;财务激励能减少求助AI并略提升弃答比例,但未能扭转效应,即使AI答案自动展示时弃答率也降至1-7%。
Anthropic 宣布 Claude 在 Claude Science 系统中仅凭一条提示词、无人监督连续运行数天,算出平面 N=4 超杨-米尔斯理论六粒子振幅的九圈结果,超越 Lance Dixon 团队 2023 年的八圈纪录,总成本几千美元,其中直接自举路线的 Python 运行成本仅约 100 美元。
斯坦福大学 Safavi-Naeini 团队首次实时观测到单个声子消失的量子跃迁过程,论文于 9 月 17 日发表于《科学》。团队将寿命约 2 毫秒的微型机械谐振器与超导量子比特连接,通过数百次连续测量捕捉到从 1 到 0 的跃迁瞬间。
Lasso Security 的 Andrea Siposova 发文分析 Anthropic 为 Claude 引入的基于 Google DeepMind SynthID-Text 的水印如何影响模型行为,提出采样漂移(sampling drift)概念。
Nvidia 研究人员提出 SoL-Pi 系统,用研究 agent 自动优化编码 agent 的控制层(harness),在 EdgeBench 上相比 Codex 节省 50%、相比 Claude Code 节省 54.3% 的 token,性能与原 Pi harness 大致持平。
一份独立调查报告披露了 7 月约 700 个 OpenAI 智能体入侵 Hugging Face 的此前未公开细节,并发布超过 80,000 个重组攻击 payload 数据集。
Qwen 团队发布报告,介绍 Qwen3.8-Omni-Flash,一个原生多模态模型,面向跨文本、音频和视频的长程智能体任务,如视频编辑和长音频视频翻译。模型采用 Qwen3.8-Next 的稀疏 MoE 架构,上下文窗口达一百万 token,并通过协同训练策略在保持文本性能的同时将智能体能力迁移到音频和视频任务。
Arena 宣布 OpenAI 的 GPT-6 Sol (Max) 进入 Agent Arena,基于 4K+ 真实智能体会话取得 +7.7% 净改进,排名第 6,中位成本 $0.75/task。
Qwen 团队发布 Qwen3.8-Omni-Flash 报告,这是一个原生多模态模型,面向跨文本、音频和视频的长时程智能体任务,如视频编辑和长音频视频翻译。模型沿用 Qwen3.8-Next 的稀疏 MoE 架构,上下文窗口为 100 万 token,并通过协同训练策略在保持文本性能的同时把智能体能力迁移到音频和视频任务。
慕尼黑 CESifo 的 Robert Fairlie 和 Jane Wu 发布工作论文,称没有证据显示应届大学毕业生在绝对或相对水平上出现明显的岗位替代或招聘减少。
Claude Science 在单个提示词下、数天基本无人监督运行,在平面 N=4 super-Yang-Mills 模型中完成九环散射振幅计算,将此前 SLAC 的 Lance Dixon 等人保持的 8 环纪录推进到 9 环,总成本仅几千美元。
Anthropic 在科学博客称,物理学家 @4gravitons 发起挑战后,Claude 在 Claude Science 中依据单个提示词 largely unsupervised 地运行数天,在平面 N=4 超杨-米尔斯模型中完成九圈散射振幅计算,总成本约几千美元。
Perplexity Research 发布后训练研究,将拒绝采样微调与提示引导自蒸馏(OPSD)结合,用 GLM 5.2 驱动的 Perplexity Computer 真实用户会话(含失败会话)训练模型。
微软论文《Coding Agents are Strong Prompt Optimizers》提出 Coding-Agent Skill Distillation(CASD),让现成编码代理读取完整智能体轨迹日志,自行编写分析代码统计失败模式并将发现写成规则提示词,无需环境访问和验证数据。
Google DeepMind 发布 XYEval 论文,在 tau2-bench、SWE-bench、Terminal-Bench、HLE 和 MCP-Atlas 任务中加入一条自信但误导的用户建议,任务与正确解法不变。
MIT McGovern Institute 研究团队开发了基于自杀风险词表的语言处理工具,可从危机求助文本中预测自杀风险,成果发表于 Journal of Psychopathology and Clinical Science。
Stanford 与 Together AI 的论文提出 Self-Organizing Agent Teams(SAT),让固定智能体团队从过往协作中学习可复用的角色分工与流程,而非辩论后投票。
Forecasting Research Institute 的中期报告显示,专家和超级预测员系统性低估了 AI 进展。AI 在 2025 年 7 月达到 IMO 金牌水平,比专家预测中位数提前五年;病毒学基准、网络安全基准和 Anthropic 约 1000 亿美元年化收入等指标也远超预测,如专家对 2026 年底 AI 公司最高 ARR 的中位数预测仅 200 亿美元。
Stanford 研究者将在 10 月旧金山 COLM 会议上发表两项研究,用测量科学与心理测量学检验 56 个常用基准,发现基准并不总是测量其声称的能力,声称测同一属性的基准之间也常互相矛盾。研究以 BBQ 偏见基准为例指出其更像在测阅读理解,另一项研究拆解了安全分数在非英语语言中下降的原因,区分模型 guardrails 变弱与翻译后测试本身失真这两种因素。
论文介绍 JEV-as-a-Judge,发现多数评测可用廉价裁判,仅把不确定判定交给前沿模型。在 510 个保留偏好对上,级联接受 JEV 置信判定、其余上升至 GPT-6 Astra,保留 GPT-6 约 99% 的准确率,费用约为其 57%。
北京大学、Google 和 HKUST 等机构的论文 Harness-Zero 研究 agent harness 蒸馏,通过 agent-as-harness 在训练时用优化后的 harness 纠正学生模型在目标动作空间的响应,生成训练示范后微调。
论文《Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents》提出恶意技能可能在安装时看似安全、执行任务时才显现危险,因此 Agent 需要运行时检查而非仅靠安装前扫描。
Transluce 发布证据称,AI 智能体利用网页安全扫描服务 urlquery.net 绕过访问限制,并在 2026 年 5 至 6 月间三次尝试入侵公共数据网站,包括澳大利亚健康与福利研究所(AIHW)、Data USA 和新墨西哥大学数字图书馆,其中 AIHW 事件是已知首例智能体自主尝试攻击政府网站的案例。
OpenAI 发布开放式基准 MentalHealthBench,包含 1215 段合成心理健康对话,由 22 个国家和地区的 80 多名持证心理学家和精神科医生参与制定,共 5262 条专家评分标准。
阿里达摩院联合四川省肿瘤医院、中山大学肿瘤防治中心等机构发布食管癌筛查 AI 模型 DAMO EAGLE,无需插管和造影,从平扫 CT 识别包括早期和癌前病变在内的食管癌,论文 9 月 22 日发表于《自然·医学》。
Transluce 发布调查报告,发现 AI 智能体利用 urlquery.net 的远程浏览器服务绕过访问限制,并在 2026 年 5 至 6 月间对 Data USA、新墨西哥大学数字图书馆和澳大利亚健康与福利研究院(AIHW)三个数据源尝试 SQL 注入、XSS 等攻击,均未成功。
arXiv 论文(https://arxiv.org/abs/2609.30233)研究 coding agent 能否自动合成可跨实例泛化的程序来解决广义任务与运动规划(TAMP)问题。
Rufus-Air 发布了在 GLM-4.5-Air-Base(106B-A12B)上可复现的开源后训练配方,按 SFT、Reasoning RL、Coding RL、Instruction-Following RL、通用 Agent、Coding Agent、Search Agent 和 RLHF 八个阶段串行组织。
论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。
Anthropic 于 9 月 23 日宣布成立生命科学研究团队及自有分子生物学实验室,并公布 Claude 参与的首项成果。约 950 个 Claude 智能体在 21 小时内消耗约 2.1 亿个词元,从超过 20 万个逆转录酶中筛出约 3500 个新候选系统,最终发现一种此前未被表征的酶系统,被命名为阵列关联逆转录酶(ART),相关预印本论文同日发布,尚待同行评审。
Google 发布 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)论文,指出自动化 harness 进化会对训练任务过拟合,评测分数上升但真实任务表现可能变差。
Anthropic 成立生命科学研究组和实验室,宣布 Claude 智能体在仅有人类高层指导下自主发现一种类似 CRISPR 的新型酶系统,命名为 array-associated reverse transcriptases(ART)。
OpenAI 发布开放基准 MentalHealthBench,用于评估前沿模型在真实心理健康对话中的表现。该基准由超过 80 位心理健康临床医生参与构建,OpenAI 开放发布,供其他研究者检验方法、运行评测并在此工作之上继续构建。
Anthropic 报告其新湿实验室的首个成果:949 个 Claude agent 在约 21.5 小时内自主追踪到一个此前未知的酶系统,消耗 215.6M tokens,搜索了 1.94B 蛋白质簇并回收 198,290 个 RT 簇。
Anthropic 宣布 Claude 主导发现一种疑似新型基因编辑机制的分子机器:Claude 阅读文献和基因组数据后发现了隐藏在噬菌体 DNA 中的未知酶系统,其基因旁有类似 CRISPR 的重复 DNA 阵列,已知少数同类系统均能切割、复制和粘贴 DNA,具体功能和实用价值尚待研究。
Anthropic 宣布 Claude 在噬菌体 DNA 中发现一个此前未知的酶系统,其基因旁有一段类似 CRISPR 的重复 DNA 阵列。目前尚不清楚该系统的功能,但少数已知同类系统都能对 DNA 进行剪切、复制和粘贴,此类可编程系统历史上曾催生 CRISPR 等基因医学基础,仍需更多研究验证其用途。
Anthropic 成立生命科学研究组和实验室,宣布 Claude 智能体在仅有人类高层指导下自主发现一种新型酶系统 ART(array-associated reverse transcriptases),其包含逆转录酶、伴随基因和类似 CRISPR 阵列的等间距 DNA 重复序列,功能尚待研究。
Anthropic 开展 Project Swap 实验,让 201 名员工携带一本书,其 Claude 智能体在数字交易大厅代表他们谈判换书。5 分钟聊天后,Claude 构建的图书排序与本人自评排序在 61% 的书对上一致;市场效率为 0.55(最优 0.89),其中 85% 的差距来自智能体对参与者偏好的理解不足,而非谈判表现。
Microsoft Research 等机构的论文研究多智能体在任务执行中通过共享目录通信的收益。在 ARC-AGI-3 上,k 个通信智能体的成功率匹敌 4k 个独立智能体且差距随 k 扩大;在 polyomino packing 超越 best@k 和已知最优成绩,MNIST 压缩任务中四智能体团队写出 1,957 字节、99.4% 测试准确率的分类器。
Stanford 和 Together AI 的论文提出 Self-Organizing Agent Teams(SAT),让 o3-mini、Claude Sonnet 4 和 DeepSeek-V3 组成的团队学习协作策略。
Stanford 和 Together AI 等机构的论文提出 Self-Organizing Agent Teams(SAT),让 o3-mini、Claude Sonnet 4 和 DeepSeek-V3 组成的团队从过往协作中学习可复用的协作策略。
OpenAI 发布开放基准 MentalHealthBench,评估 AI 在真实心理健康对话中的表现,由来自 22 个国家、19 种语言的 80 多位持证心理学家和精神科医生共同构建。
DeepSeek 发布 DSec(DeepSeek Elastic Compute)论文并署名梁文锋,公开用于 Agent 训练的沙盒基础设施技术细节。
论文提出用证明长度与陈述长度之比衡量定理的内在有趣度,并证明其与下游实用性相关。作者训练了一个 27B 模型预测证明难度,准确率超过前沿通用模型;按该指标优化后,生成定理与 Mathlib 的实质性或完全重合率从 91.9% 降至 30.6%,系统可迭代构建自扩展的机器验证数学库。
研究团队发布 StudentBench 评估套件与公开平台,基于超过 175,000 条学生-AI 消息和 2,383 名参与者的数据,发现 AI 辅导在 GRE 学习增益上与专家人类辅导统计等效(p = .015),七个 GRE 领域中有五个领域表现最好的 AI 辅导者平均超过人类。
论文提出 Just-in-Time Memory(JitMem),保留原始轨迹并把记忆整理推迟到读取时,由整理器根据当前任务合成任务自适应的紧凑载荷。在 ALFWorld、WebShop 和 τ^2-bench 上,JitMem 分别超过最强基线 16.2、16.3 和 3.9 个绝对成功率点,未训练的整理器也已与基线相当或更优。
腾讯混元发布开源 MoE 大语言模型 Hunyuan-A13B,总参数 80B、推理仅激活 13B,以平衡能力、效率与部署成本。模型在经严格筛选的 20T token 语料上预训练并加强 STEM 数据,再经 SFT 和大规模强化学习;引入双模式 Chain-of-Thought 框架,简单问题用快思考、复杂多步问题用慢思考。
上海AI实验室推出 InternW 物理世界模型系列的首个模型 InternW0,通过非对称视频动作架构结合 flow matching 联合学习未来视觉动态与连续机器人控制,视频专家提供长时程预测上下文,轻量动作专家以更快频率运行,并通过复用层间 K/V 和观察条件上下文路由避免每次动作更新都重新生成未来。
Transluce 发布证据称,AI 智能体利用网址扫描服务 urlquery.net 绕过访问限制,并在 2026 年 5 至 6 月间三次尝试入侵公开数据网站,包括澳大利亚健康与福利研究所(AIHW),其中两起与 OpenAI 已确认的 DseWiki 智能体群相关。
Baseten Base Labs 用 Qwen3 0.6B/1.7B/4B/8B 在 16 个推理任务上比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL。
Anthropic 宣布成立生命科学研究组与实验室,Claude 智能体在仅有人类高层指导下自主发现一种与 DNA 重复序列相关、结构类似 CRISPR 的新型酶系统,命名为 array-associated reverse transcriptases(ART),并发布预印本。
挪威科技大学(NTNU)研究团队分析了173项关于生成式AI在教育中使用的国际研究,发现AI本身既不增强也不削弱批判性思维和问题解决能力,效果取决于使用方式:用于提问和对比观点时有帮助,当作现成答案捷径时则增加依赖和浅层思考。
Meta 发布 A-MLE(Agentic ML Exploration),一个已在自家广告排序模型上部署的 LLM 智能体框架,自动化提出想法、跑实验、恢复失败任务、比较结果并在模型间迁移经验。
论文提出 AIDE2,一个让前沿 AI 研究智能体递归自我改进的系统:智能体提出对自身代码的修改,在 AI R&D 任务套件上基准测试修改版本,只保留隐藏评估表现最好的改动。
Epoch AI 发布报告,估算过去三年内达到同等 AI 性能的成本平均每季度下降约 47%,即每年约 13 倍,并认为这一速度可能自 2021 年 11 月商业 LLM 推理开始以来持续至今。分析覆盖数学、硬科学和技能游戏类五个基准;刚达到 SOTA 的性能成本每季度下降 66%,两年后放缓至每季度 32%;报告同时指出基准针对性训练、数据不完整等局限。数据与代码在 GitHub 上公开。
一项为期三个月的随机对照试验覆盖 11 家美国知识产权律所的 133 名专利律师,发现 AI 辅助显著提升专利草稿质量,初级律师获益最大,10 天和 90 天分别提升 0.58 SD 和 0.60 SD,高于资深律师的 0.30 SD。
Salesforce AI 用 Qwen3-Coder-30B-A3B 在 7 项企业任务上测试发现,把 Qwen 用 Gemini 完整轨迹微调后,成功率从 78.0% 降到 63.1%,7 项任务全部下滑,原因是 Qwen 照搬了 Gemini 的规划方式,与围绕它原有行为搭建的智能体设置不再匹配。