央视年度AGI人物引热议:梁文峰杨植麟落选?
央视评选2026中国年度AGI人物,名单未见DeepSeek创始人梁文峰与Kimi创始人杨植麟,引发讨论。两人均出身广东,与何凯明并称当地AI人才代表,分别以湛江高考状元和广东省信息学竞赛一等奖、自主招生清华的背景进入AI领域。
广东籍AI人才辈出:潮汕杨植麟、广州何凯明、湛江梁文峰,三人分别为广东省信息学竞赛一等奖、广东省高考状元、湛江市高考状元。梁文峰26岁独自驾车深入西藏阿里无人区400公里,被困一周后走出,车留在原地。其敢赌敢输、极致利用资源的性格,与DeepSeek不融资、不社交、以十分之一成本做出匹敌成果的打法一脉相承。
Cursor 与 SpaceXAI 发布 Grok 4.6,定位为可在多步骤中持续工作的模型,覆盖研究、跨代码库工作与逐轮构建应用等长时任务。它在 Grok 4.5 基础上经补充训练,并在较长轨迹上观察到更多自测与验证行为。Grok 4.6 已在 Cursor 和 Grok Build 提供,API 价格为每百万输入 token 2 美元、输出 token 6 美元。
与 OpenClaw 创始人 @steipete 的无过滤问答 @hrudolph 和 @Pat_Erichsen 向 Peter 提出了社区问题,涉及 OpenClaw 的未来方向、即将发布的版本,以及智能体如何改变软件开发。 The ClawCast 第 7 集:https://openclaw.ai/podcast/episode-7
电脑工作中最有价值的两大技能: - 重复性工作流:善于向AI助手完整阐述决策树 - 横向不可预测工作:善于在任务前预先说明AI无法知晓的每个复杂因素
Grok 4.6 在另外两项基准测试中夺得第一!🔥 • 3DCodeBench:54.0%,通过代码创建引擎就绪的 3D 资产。 • CadGenBench:40.9%,根据设计提示词生成 CAD 模型。
Grok 4.6 在 OfficeQA Pro 上以 63.2% 的准确率排名第一,超越 Opus 5、Fable 5 和 GPT-5.6 Sol。 该基准测试考察 AI 模型使用真实职场文档和工作流程回答专业办公问题的能力。 Grok 4.6 又一次重大胜利!🔥
Grok 4.6 在 Harvey 法律智能体基准中正式排名第一 🥇 它在真实多步骤法律工作中得分 22.0%,远超 Fable 5 的 14.2% 和 Grok 4.5 的 12.9%。
Grok 4.6 在 InferenceEval 上拿下第一名 🔥 🥇 Grok 4.6 - 46.9% 🥈 GPT-5.6 Sol - 44.1% 🥉 Opus 5 - 43.0% 相比 Grok 4.5 还提升了 5.6 个百分点,在解决真实世界 AI 推理编码任务方面进步显著。
DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。
在@Research_FRI对专家和公众的调查中,再培训支持是应对AI经济影响最受青睐的政策选项。 这些项目有效吗?
这里有七个 Grok 4.5 对比 4.6 的视频! 帝国时代克隆版
我做了一个短视频,讲述 Shoggoth 的历史--它既被用作后训练圈的一个梗,也是一个更深刻的隐喻。想想新一代做后训练的人可能根本不知道它,真是疯狂😱。在我看来,这仍然是一个非常贴切的隐喻。
Databricks 的 serverless 平台每天启动数千万台 VM,其网络配置交付机制面临规模挑战。文章介绍了该平台如何高效完成这一交付过程,确保大规模基础设施的稳定运行。
Amtrak 正为 50 多年来最大规模转型构建数据骨干,将每列新列车组视为数据生成资产。该智能平台连接列车运营与维护数据,支撑其现代化改造。具体技术架构与部署细节未在原文中展开。
马斯克称 Grok 4.7 将超越所有现有模型,并称 SpaceX 训练语料独特,在真实工程任务上难有敌手。博主认为 Grok 4.6 已是期待中的飞跃,若 10T 参数模型尚未发布,马斯克所言或可成真。同时指出 Anthropic 的 Fable 5.5 蓄势待发,未来数周竞争将十分激烈。
GitHub Copilot 应用发布入门指南,教用户写出第一条提示词,并学会选择合适的上下文与模型,从而自信地开启首个任务。该指南面向 Copilot 应用的新手用户,帮助其快速上手提示词编写。
与 @ajambrosino 的典型对话 A:核心对齐已经达成 T:你说核心对齐 A:我是说 T:多说点 A:更多 然而,我从未对他和团队正在构建的东西感到如此兴奋。
👀 看起来很有可能。 【引用 @elonmusk】:@cognition Grok 4.7 将超越所有现有模型。 话虽如此,Anthropic 是一家伟大的公司,可能很快就会发布改进后的模型。 然而,SpaceX 训练语料库如此出色且独特,如果有任何模型在真实工程领域比 4.7 更强,我会感到震惊。
26款商用大模型每百万token混合成本对比显示,Grok 4.6在Fable 5智能指数得分61分,仅比Claude Fable 5 Max的62分低1.6%,但输入token成本低80%($2 vs $10/M),输出token成本低88%($6 vs $50/M),成为智能-价格比最优选择。
性能与价格正成为AI模型竞争核心。Grok 4.6已跻身顶级行列,但价格显著优于对手;DeepSeek 4 Pro GA定价更低,$0.435/M输入、$0.87/M输出,支持1M-token上下文,性价比优势愈发关键。
SpaceXAI的Grok 4.6在人工智能分析指数中得分61,与GPT-5.6 Sol持平,仅次于Claude Opus 5和Claude Fable 5。其智能体性能突出,GDPval-AA v2 Elo达1753,定价维持$2/$6每百万token,较Claude Opus 5和GPT-5.6 Sol低60%以上。上下文窗口为500k tokens,每任务成本$0.84。
试试 Grok @Bot 【引用 @yunta_tsai】:Grok Bot 能够 a) 浏览日历,找出我尚未完成但需要提前预订的事项,b) 确定最佳预订时间,c) 在网站上完成预订操作。 在我走到车前穿过停车场时,我正用中英混合的语言与它对话。 印象深刻。
DeepSeek-V4-Pro-0813 在 reasoning_effort=max 时,长程 AgenticCoding 任务(50 轮代码优化)中 3 次测试有 2 次在 42-43 轮提前停止,未用完全部机会,且成绩未超过 GLM-5.1。作者推测可能与强化学习奖励机制或上下文窗口注意力衰减有关,将发布详细评测视频。
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。
Grok 4.6 在 Artificial Analysis 的 AA-Briefcase 智能体知识工作基准上取得大幅提升,与 Claude Fable 5 并列领先(置信区间重叠)。其单任务成本仅 $4.42,远低于 Claude Fable 5 的 $22.30、Claude Opus 5 的 $17.79 和 Kimi K3 的 $6.73。该测试集为私有,可防止数据污染。
在拉斯维加斯Ai4大会上,Geoffrey Hinton、李飞飞和吴恩达一致主张AI应保持开放,反对少数大公司垄断技术进程。吴恩达强调"不希望有守门人",并担忧美国开源AI难以与中国开源权重模型竞争;Hinton虽曾反对开放权重,但承认"这场战斗已经输了";李飞飞则主张分层开放。三人均认同需要一定程度的监管。
我看有说max有问题high没问题的,我再把high也跑一下一起对比 【引用 @MistymoonR】:@karminski3 这模型最大特点是不思考就直接干活🧐 就像是已经知道标准答案呢
Grok 4.6 相比 Grok 4.5 是巨大提升 🚀 Mercor 的 APEX 基准测试显示,在每个专业领域都有显著进步: 🏛️ 公司法:49.6% → 62.5% 💰 投行:39.2% → 50.2% 📊 管理咨询:51.0% → 59.8% 🧮 会计:40.8% → 50.9% 试试 @Grok 4.6
本教程基于 AllenAI 的 Open Instruct 框架,构建了一个端到端的后训练流程,涵盖监督微调、直接偏好优化和基于 GRPO 的可验证奖励强化学习三个阶段。该流程将原多 GPU 的 Tulu 3 栈适配至 16 GB 运行时,用轻量级 Hugging Face 和 PyTorch 实现替换 vLLM、Ray、DeepSpeed 等分布式组件,并利用确定性验证器评估数学答案。
Dex Horthy 反驳"模型只是比你聪明"的说法,认为前沿模型没有"智能"只有"能力",且其服务能力已出现回退。他批评 Altimor 将模型晦涩表达视为更高智能的观点,强调人类不可用的模型没有价值。
一项覆盖5,000多个网站的持续更新分析发现,有人正冒充ClaudeBot等AI机器人进行大规模漏洞扫描。该分析追踪了机器人流量、AI抓取、搜索索引、robots.txt合规性及AI聊天推荐等行为,揭示出伪装成合法AI爬虫的恶意扫描活动。
咋感觉要拉啊………别啊…. 😇 #deepseekv4pro0813 #deepseekv4pro正式版
Grok 4.6 的帕累托黄金。 即使 OpenAI 降价后,Grok 和 Cursor 仍实现绝对帕累托支配。
Grok 是最高效的高智能 AI。 【引用 @ArthurMacwaters】:Grok 4.6 可以说是每美元智能最高的模型。 这是一个极其重要的指标。
xAI 的 Grok 4.6 在 Artificial Analysis 智能指数上得分 61,与 GPT-5.6 Sol 并列前沿,仅次于 Anthropic 的 Claude 系列。其智能体性能突出,GDPval-AA v2 Elo 达 1753,定价维持 $2/$6 每百万 token,较 Claude Opus 5 和 GPT-5.6 Sol 低 60% 以上,位居智能与成本帕累托前沿。
Sandbar CEO Mina Fahmi 在 TechCrunch 的 Equity 节目中表示,AI 可穿戴设备的未来在于语音交互。他同时指出了其他 AI 硬件公司在产品方向上的失误,但未透露具体产品细节或参数。
《Clinical Imaging》一项针对215名乳腺影像学会成员的调查显示,约半数已在用FDA批准的AI工具,另有11%计划采用,但仅少数人视其为决定性因素。实际效果低于预期:仅35%报告召回率降低(59%曾预期)、9%看到不必要活检减少(36%曾预期)、29%感到倦怠减轻(56%曾预期)。成本与机构支持不足是主要障碍。
Karina Nguyen 用 114 道提示词对比 Grok 4.6、Grok 4.5、Claude Opus 5 与 GPT-5.6-sol,占星师独立评估显示 Grok 4.6 综合最强,技术准确且引用 NASA 级天文数据。Grok 4.6 擅长挖掘问题下的隐藏结构,但有时过度相信深层解释;Claude 学术更强,GPT 压缩综合更强。
HumanLayer 发布 show-me 技能,提示编码智能体用组件树、调用栈、图表、伪代码等紧凑可视化代替大段文字,比 HTML 更轻更快。该技能已上线 HumanLayer,也可用于其他编码智能体,旨在改善智能体输出可读性,适用于程序设计和大型 diff 审查。
DeepSeek 4 GA 基准测试已流传,性能提升扎实,但对比对象是 Opus 4.8 而非 Opus 5。测试结果稳定,与开源 SOTA 模型 Kimi k3 和 GLM-5.2 持平,接近 5.6 Sol 和 Fable 5 的表现。DeepSeek v4 Pro GA 与 Grok 4.6 API 同步推出。
三组新数据显示 Google Gemini 市场份额持续下滑。Pangram 分析显示,OpenAI 每月份额始终超 50%,Anthropic 从 4.3% 升至 14.9%,而 Gemini 在 2026 年 7 月从 12% 暴跌至 1.9%,OpenRouter 数据也印证了这一趋势。Similarweb 显示 Google 网站份额环比微降至 26.8%,但一年前仅为 9.4%。
SpaceXAI 的 Grok 4.6 在 Artificial Analysis 智能指数上得分 61,与 GPT-5.6 Sol 并列前沿,仅次于 Anthropic 的 Claude 系列。该模型智能体性能突出,GDPval-AA v2 Elo 达 1753,且定价不变($2/$6 每百万 token),成本较 Claude Opus 5 和 GPT-5.6 Sol 低 60% 以上。
突发:Grok 4.6 在 GDPVal-AA 基准上夺得榜首 🏆 • Grok 4.6 - 1,753 Elo • Fable 5 Max - 1,741 • GPT-5.6 Sol Max - 1,728 • Grok 4.5 High - 1,526
当 AI 模型能以极低成本快速生成可用代码,代码生成本身不再是开发者平台的差异化优势。GitHub 押注编排,通过 Agent HQ 在临时云环境中协调多家模型供应商的智能体;Vercel 押注生产路径,基于隔离 microVM 沙箱;Replit 则押注验证,用真实浏览器驱动的自测循环捕捉"看似能用"的代码。三家公司均支持 MCP 标准,让任意智能体接入任意工具。
新增了skill: /ljg-classic 在小红书上看到解读文言文的一类模板卡片,试着写了一版。 用途:将文言文做逐字解读+章节释义 用法:/ljg-classic 《金刚经》第一品
书商怀疑AI公司正购买稀有书籍后将其拆毁扫描,以获取高质量长文训练数据。尽管拆页扫描是成本最低的快速数字化方式,但爱书者担忧这一做法规模远超报道,部分实体书将永久消失。
Florian Herrengt 指出,AI 辅助开发正让项目变得极其复杂,以至于团队成员无法理解系统全貌。当用户报告 bug 时,团队只能反复让 AI 修复,甚至负责该功能的工程师也不清楚数据来源,只能求助 Claude。项目层层叠加,无人能真正掌握其运作,AI 正在移除软件工程的中产阶级。
我最新这篇文章有点冗长,但我认为它确实是一个很好的例子,深入探讨了某种知识工作(甚至可以说是科学)--即在知名领域撰写类似AI教科书的内容--而模型目前还远未接近解决这一问题。https://www.interconnects.ai/p/i-wrote-an-ai-textbook-how-long-until
我喜欢现在所有AI评论家都需要假装自己一直对一系列只有专业专家才听说过的未解数学问题有着细致入微的理解:"格罗姆拉赫猜想对r维矩阵不成立,哇,这比上周对受限样条的埃尔德什问题444的解法更令人印象深刻!"
AI 让弱工程文化的项目更快崩溃:工程师一天能生成过去一年的代码量,但无人真正理解系统,修复错误比创建错误困难得多。团队中不再有人能解释数据来源或设计决策,只能依赖 LLM 对话记录。当 25,000 行的 PR 成为常态,资深工程师的审查与架构职责被架空,软件工程的中层角色正被系统性削弱。
AI 终局应用,是一个浏览器。一个可以打开一款名为"浏览器"的内部官方应用的浏览器。
更新了 /ljg-card 把之前写的读书笔记扔进去测试一下,阅读起来更舒适些了。
MiniMax H3 开源一周即在 Hugging Face 衍生出近 300 个模型,ComfyUI 版本下载量近 700 万。社区将 120GB 权重压至 42.5GB 以在消费级显卡运行,Redis 作者 antirez 用 C 和 Metal 重写原生 Mac 推理引擎 h3.c。