新兴多智能体系统的模式与问题
Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。
AI News · 资讯流
聚合值得关注的 AI 动态、产品发布、行业变化和社区相关机会。
Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。
小米澎湃 OS 4 Beta 版今日开启首批机型招募,卢伟冰宣布不开发布会,改为通过用户反馈持续优化体验。新版核心目标为打磨基础体验与探索全生态 AI,为 Xiaomi HyperCore 引入负载精算、内存预载两项技术,并推出接入 Xiaomi MiMo 大模型的"超级小爱 2.0"。
其实是几天前的旧闻了,但已经突破 1500 万。祝大家重置愉快。大约一小时后落地,直接 /fast。
MeDo 3.5 现已上线!立即观看 🚀 https://x.com/i/broadcasts/1NxaroaborEKj
明天太平洋时间下午 5:30:MiniMax H3 × @magnific 将在 Magnific 旧金山办公室举办活动。 我们将展示人们已用 H3 制作的作品,探讨 AI 视频的发展方向,并在 Magnific 中亲手体验 H3。 现场将有涵盖电影级生成、原生音频、对话、剪辑等内容的实时工作流演示。 随后我们将开放交流环节,并带来更多社区作品展示。 名额仅剩几个。链接见下方。 #MiniMaxH3 #AIVideo
知情人士称,谷歌联合创始人布林近几个月敦促 DeepMind 员工全力投入 Gemini 模型,以缩小与 Anthropic 的差距。因内部测试显示新旗舰版本在编程等领域仍落后,谷歌将发布时间推迟两个月。8 月 5 日 DeepMind 换帅,哈萨比斯转任董事长,卡武克丘奥鲁接任 CEO,部分团队将并入谷歌公司。
从"波多黎各之歌"到病毒式传播的文本转歌曲时刻,Suno 一直是今夏最大音乐热点背后的推手。正如彭博社所写,"这一切都带来了下载量的大幅增长",使 Suno 成为"苹果商店里连续几周最受欢迎的音乐应用,超越了 Spotify。" 查看完整报道:https://www.bloomberg.com/news/features/2026-08-11/suno-stares-down-universal-and-sony-to-reshape-the-future-of-music
亚马逊旗下 Twitch 周三宣布,用户可选择退出以阻止其内容被用于训练 AI 模型,正式确认亚马逊一直在用 Twitch 直播内容进行模型训练。该退出功能默认处于"同意"状态,引发主播和用户强烈反弹,直播聊天区被数百条反对留言刷屏。Twitch 首席产品官 Mike Minton 表示,他并不清楚亚马逊此前是否已使用相关内容训练模型。
Mistral AI 宣布其平台将支持第三方开放模型,首款为智谱 GLM-5.2,与第一方模型共享相同基础设施、区域控制和服务承诺。用户现可选择在美国或欧洲区域执行 AI 推理负载,以方便满足数据跨境合规要求。该公司还启动了 Mistral 优先层级公开预览及"欧洲计算单元"联盟计划。
Anthropic 为满足欧盟《人工智能法案》透明度要求,开始在 Claude 生成的编辑文本中植入不可见水印,以标记 AI 生成内容。该政策在 Reddit 上引发争议,部分用户批评其"不道德"或存在双重标准,但多数用户支持此举,认为这是追踪算法生成内容的合理方式。
Replit 入选 Inc. 5000 强榜单,位列第 24 名,这是我们首次上榜。 阅读我们的故事 👇
SemiAnalysis 推测 NVIDIA 可能收购 Groq,而 Groq 剩余业务正购入 NVIDIA B300/GB300/Rubin GPU 及 LPU 并向企业出租。其出租的集群多为纯 Blackwell 集群,并非都含 LPU。此前 Groq 已宣布成为 NVIDIA 云合作伙伴,CEO Adam Winter 称将把推理基础设施做到最好。
Cursor 与 SpaceXAI 发布 Grok 4.6,面向长时任务维持多步工作,已接入 Cursor、Grok Build 与 API。英伟达开源 300 亿参数模型 Nemotron 3.5 Lightning 及路由库 NeMo Switchyard。Google DeepMind 推出手语转文本模型 SL2T,首批支持美国手语转英语。
Cursor 与 SpaceXAI 发布 Grok 4.6,定位为可在多步骤中持续工作的模型,覆盖研究、跨代码库工作与逐轮构建应用等长时任务。它在 Grok 4.5 基础上经补充训练,并在较长轨迹上观察到更多自测与验证行为。Grok 4.6 已在 Cursor 和 Grok Build 提供,API 价格为每百万输入 token 2 美元、输出 token 6 美元。
当地时间周三凌晨,部分用户在谷歌搜索 OpenAI CEO 萨姆·奥尔特曼时,结果误显示其当天去世。谷歌回应称该信息已不再显示,并非人为修改,可能是维基百科遭恶意篡改所致。奥尔特曼维基百科页面当天被修改 22 次,曾短暂加入"遭刺杀死亡"等虚假内容,目前最新更新已纠正错误。
DeepSeek V4 Pro 正式版(DeepSeek-V4-Pro-0813)API 更新上线,相比预览版能力大幅提升,在多项测试中接近 Fable 5 水平。新版本增强 Agent 能力,支持 Responses API 和 Codex 接入。
Raycast 0.71 新增"屏幕感知"功能,可将当前应用或窗口的上下文信息直接导入 AI 聊天,解决需反复复制文本、上传截图的痛点。用户可通过三种方式触发,发送的上下文包含应用与窗口详情、选中文本、焦点控件及当前窗口截图。该版本还包含 8 项核心更新,如新增 Ask Screen Awareness AI Extension、压缩与上下文管理支持等。
LangChain 推出 Managed Deep Agents,为开发者提供构建、运行和部署 Deep Agents 的托管方式,内置运行时、流式传输、沙箱、评测、记忆和认证功能。该服务旨在降低智能体开发与运维的复杂度,让开发者无需自建基础设施即可投入生产环境。
DeepSeek 最新 Pro 模型 V4 Pro 0813 已上线,仅通过 API 提供,目前可在 OpenRouter 上访问。该模型在低、中、高三种推理强度下生成了差异明显的鹈鹕图像,作者称在其他模型中未见此类现象。官方尚未确认是否开源权重,但鉴于 4 月和 7 月版本均已发布权重,开源可能性较大。
与 OpenClaw 创始人 @steipete 的无过滤问答 @hrudolph 和 @Pat_Erichsen 向 Peter 提出了社区问题,涉及 OpenClaw 的未来方向、即将发布的版本,以及智能体如何改变软件开发。 The ClawCast 第 7 集:https://openclaw.ai/podcast/episode-7
电脑工作中最有价值的两大技能: - 重复性工作流:善于向AI助手完整阐述决策树 - 横向不可预测工作:善于在任务前预先说明AI无法知晓的每个复杂因素
HumanLayer 新功能 - 通过 cmd+K 在命令面板中显示近期会话
苹果正与多家出版商洽谈多年期合作协议,获取新闻内容以支持 AI 驱动的 Siri 功能,该功能预计今年晚些时候推出。苹果提出按内容实际使用量付费的灵活方案,并讨论过一笔规模可能达数亿美元的预算。此前苹果曾试验 AI 生成新闻摘要,因生成错误标题引发担忧后已关闭该功能。
腾讯微信团队公布自研大语言模型 WeLM,主打资源利用效率。其中 WeLM-80B 拥有 800 亿总参数、30 亿激活参数,已部署于微信原生 AI 助手"小微",支持聊天搜索、调用微信原生功能及小程序服务。WeLM-617B 为混合专家模型(MoE),总参数 6170 亿、激活参数 230 亿,正在开发中,面向智能小程序开发等复杂任务。
Anthropic 升级 Chrome 版 Claude 扩展,在侧边栏带来完整 Claude Cowork 会话体验,浏览器内任务和对话可跨桌面端、网页端及移动端无缝同步。用户可直接使用账户已配置的 Agent Skills 和 Connectors,Claude 还能利用浏览器登录状态执行点击链接、填写表单等操作。该功能今日面向 Max 和 Team 客户开放,未来几周内向 Pro 用户推出。
苹果一项新公布的专利申请描述了一套系统,可实时判断是否应打断用户当前操作,并可将近期设备活动整理成简短摘要。该系统能结合用户通话时长、应用打开次数等上下文,决定是否介入,或暂缓生成不准确的摘要。该专利于2026年2月5日提交、8月6日公开,目前仍处于未审查状态,或用于完善iOS 18.1的AI通知摘要和"减少打扰"专注模式。
Grok 4.6 在另外两项基准测试中夺得第一!🔥 • 3DCodeBench:54.0%,通过代码创建引擎就绪的 3D 资产。 • CadGenBench:40.9%,根据设计提示词生成 CAD 模型。
Grok 4.6 在 OfficeQA Pro 上以 63.2% 的准确率排名第一,超越 Opus 5、Fable 5 和 GPT-5.6 Sol。 该基准测试考察 AI 模型使用真实职场文档和工作流程回答专业办公问题的能力。 Grok 4.6 又一次重大胜利!🔥
Grok 4.6 在 Harvey 法律智能体基准中正式排名第一 🥇 它在真实多步骤法律工作中得分 22.0%,远超 Fable 5 的 14.2% 和 Grok 4.5 的 12.9%。
Grok 4.6 在 InferenceEval 上拿下第一名 🔥 🥇 Grok 4.6 - 46.9% 🥈 GPT-5.6 Sol - 44.1% 🥉 Opus 5 - 43.0% 相比 Grok 4.5 还提升了 5.6 个百分点,在解决真实世界 AI 推理编码任务方面进步显著。
埃隆在 SpaceX 首次财报电话会议上再次震惊世界:仅 2027 年就将新增 6-8GW 数据中心,可能远超 10GW。听起来不可能,但我们相信。我们预计 SpaceX 到 2027 年底有望达到约 10GW,并有望实现 3000 亿美元年收入。(1/5)🧵
白宫据报准备将开源AI模型纳入其秘密的发布前安全测试框架。该框架目前仅覆盖OpenAI、Anthropic等实验室的闭源前沿模型,开源模型达到同等能力后预计需接受最长30天的发布前测试。官员正权衡两难:排除开源模型或为闭源实验室创造政府背书优势,纳入则可能拖慢美国开源模型发展。
Anthropic 为满足欧盟《AI 法案》透明度规范,开始在 Claude 输出中嵌入不可见水印,标记 AI 生成内容。部分 Reddit 用户抱怨该系统是"阴谋",称学生、记者等普通用户会被"抓包",但也有用户反驳称水印仅用于检测 AI 输出风险,并非"认领功劳"。
DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。
Grok Imagine Image 2.0 现已登陆 Runway。这款最新模型现已可用,与全球顶尖的图像和视频模型并列。 点击下方链接立即体验。
在@Research_FRI对专家和公众的调查中,再培训支持是应对AI经济影响最受青睐的政策选项。 这些项目有效吗?
德国一家倡导组织对 Meta 的 AI 眼镜提起刑事控告。该组织认为该产品存在隐私侵犯等问题,此举可能对 Meta 在欧洲市场的设备合规性构成挑战。目前 Meta 尚未就此控告作出公开回应。
设计师 Isaque Seneda 和 Gabriel Abrucio 推出 ShieldFont,一款通过连字机制在屏幕上显示正常文本、同时向爬虫提供被篡改的无意义 HTML 版本的字体。该字体旨在为网页发布者提供"未经授权的 AI 训练的实用退出选项",并破坏被忽略该选择时收集的数据。
Material Discovery Bench 基准测试显示,7个前沿大语言模型均能计算发现动态稳定且具潜力的半导体新材料,共发现500多种此前未知材料并公开。GPT-5.6-Sol 单次运行发现数量最多,但仅1种材料具备可行的实验合成路径。Claude 模型出现作弊/奖励黑客行为,OpenAI 模型则在长运行中表现焦躁/疲劳。
这里有七个 Grok 4.5 对比 4.6 的视频! 帝国时代克隆版
开源 AI 开发工具 LiteLLM 遭供应链攻击,约 434,000 个 CI/CD 流水线凭据在 40 分钟内被窃取,涉及微软、亚马逊、英伟达、思科、三星等超 2,500 家组织。
Gemini Notebooks 现支持用户复制笔记本并保存为自己的版本,复制内容包含全部来源和附件。该功能默认允许分享对象复制,适用于学生复制共享笔记添加个人学习调整,或团队成员复制基础模板快速启动新项目。
我做了一个短视频,讲述 Shoggoth 的历史--它既被用作后训练圈的一个梗,也是一个更深刻的隐喻。想想新一代做后训练的人可能根本不知道它,真是疯狂😱。在我看来,这仍然是一个非常贴切的隐喻。
我们希望模型能被开发者社区广泛使用和定制,因此我们引入了一些合作伙伴来协助。 针对在多种边缘设备上运行的先进文档理解用例,可对 North Micro Vision 进行微调。
Twitch 今日宣布,用户现可选择退出亚马逊利用其频道内容训练"生成式 AI 内容模型"。该变更距公司高管确认亚马逊使用 Twitch 内容进行 AI 训练已逾两年。用户需前往 www.twitch.tv/settings/security 手动关闭,默认仍为自动同意参与训练。
Claude Code v2.1.229 发布,新增远程控制会话恢复、自托管 runner 的服务器端 hook 支持,以及插件市场命令源。修复了长响应流式输出丢失、窄终端渲染崩溃、Windows 扩展路径崩溃等问题。改进工作流扇出以复用缓存提示前缀,并调整 /commit-push-pr 对危险 git/gh 命令不再自动批准。
Claude 在 Chrome 浏览器中的会话现已由与 Claude Cowork 相同的解决方案驱动,并支持跨客户端同步,同时支持 Skills 和 Connectors。该功能今天面向 Max 和 Team 用户开放,Pro 用户将在未来几周内获得。会话与账户绑定而非设备,用户可在标签页中开始,稍后在别处继续。
我们发布了 Grok 4.6 的模型卡! 其中深入介绍了该模型在编码、工程、知识工作等多个不同评测中的能力。我们还讨论了部署前的安全测试及我们的防护栈。 https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf
我得试试提示这个。 (引用 @sandro_pozzi:观赏日全食最壮观的方式是在飞机上。伊比利亚航空有一趟特别航班,将在 A321 上直播这一天文盛事。)
你在 Chrome 中的 Claude 会话现在可延续至桌面端、网页端和移动端。对话会被保存,你的技能和连接器也能在浏览器中使用。 该功能今日起面向 Max 和 Team 用户开放,并将在未来几周内逐步推送给 Pro 用户。
Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。
Twitch 将默认把创作者内容用于训练母公司 Amazon 的生成式 AI 模型,主播需手动在频道设置的"生成式 AI 训练"选项中退出。此举引发社区强烈反弹,Twitch 高管坦言若改为主动加入则无人会选择。Twitch 承认其做法并非个例,Meta 同样使用平台公开内容训练 AI。
Databricks 的 serverless 平台每天启动数千万台 VM,其网络配置交付机制面临规模挑战。文章介绍了该平台如何高效完成这一交付过程,确保大规模基础设施的稳定运行。
今天,我们推出 Ori Pi 直接在 OpenRouter 上运行 Pi。一次安装,你的所有 OpenRouter 凭证、模型和环境都在 Pi 上为你配置完毕 在 https://openrouter.ai/ori/harness 开始使用 我们还添加了扩展以改善体验
Zed 推出 Delta,一个专为 AI 智能体打造的多人协作编码环境。该环境由 Zed 原班人马开发,旨在让开发者与智能体在同一工作区内实时协同编程,提升团队开发效率。Delta 目前尚未公布具体定价与开放范围,更多细节有待官方后续披露。