11 家机器人公司的人形与四足机器人走上 IFA 秀场
PrimeBot、EngineAI、Dobot、DEEP Robotics、AgiBot、宇树等公司参与。同展会上 MagicLab 展示了部署 VLA(视觉-语言-动作)模型的人形机器人。
这七天里,三家前沿实验室在 72 小时内各发了一款模型,两家用的是同一种发布形态;GitHub 上冲得最猛的不是任何一份权重,而是跑权重的壳。下面按「本周的主线 → 模型对照 → GitHub 星榜 → 完整时间轴」排,所有数字都标了来源与证据档位。
GitHub 的星数、fork 数、创建日期是 2026-09-07 经 api.github.com 逐仓实查的快照,属 A 档;模型跑分与融资金额多为媒体转述,属 B 档,我只对影响判断最大的几条回了一手。
凡标 C 的条目不要写进对外材料,它们在这里只是为了说明「这条为什么还不能当事实用」。
9/1 Anthropic 同时放出 Claude Fable 5.1 与 Mythos 5.1——同一个底模,两套护栏:Fable 5.1 面向所有人,Mythos 5.1 只向经审核的网络安全与生命科学机构开放。9/2 Google 的 Gemini 3.8 Flash 也带了一个锁死的兄弟版 3.8 Flash Cyber。9/3 OpenAI 发 GPT-6 Astra,先给 Daybreak 计划的公司,随后才到 Plus / Pro / Business / Enterprise 与 API。
把「高危能力」从通用产品里切出去、单独走审核发放,这一周成了三家里两家的默认动作,而不是个别选择。
据报道,GPT-6 Astra 用的是 recurrent depth(循环深度 / 循环 transformer):同一批 token 在同一组层里反复过多轮,在潜空间里推理,而不是把思考过程写成自然语言。效率上去了,代价是留下的链式思维记录变少。
OpenAI 自己说,在「明确要求模型规避监控」的评测里,Astra 的书面推理比 GPT-5.6 Sol 更难监控。这是厂商第一次把「新架构降低了可监控性」写进自己的发布材料。
DeepSeek 8 月 13 日以 MIT 开源的 deepseek-harness(「万物皆插件」),到 9 月 7 日已经 214,016 星 / 25,185 fork——这个量级在开源史上极罕见。围着它长出来的生态同样在榜上:桌面端 dsh-desktop 23,956 星、插件精选清单 14,669 星,带 dsh-plugin 话题的仓库有 13,792 个。
同期上榜的 xai-org/grok-build(26,520)、yc-software/qm(14,634)、truefoundry/trueforge(5,268)在自我描述里全都用了同一个词:agent harness。7 月 1 日之后新建、名称或简介里出现这个词的仓库有 3,584 个。
8/31 起的一周里:Anthropic 与英伟达投资的 Lambda 敲定六年、350 亿美元云算力协议,数据中心在德州 Nueces County、约 350MW,租约由英伟达持有、由比特币矿企 Hut 8 建设;博通正在寻求 600 亿美元以上的 AI 芯片相关债务融资,Apollo 与 Blackstone 参与,Anthropic 是锚定租户;人形机器人公司 Figure 与 Nscale 签下 35 亿美元起、可能超 60 亿的算力承诺,最多 10 万张英伟达 GPU;Crusoe 与 Jane Street 签五年约 130 亿美元;a16z 第五期成长基金 85 亿美元关账;Nscale 计划 9 月在美 IPO 募资至多 30 亿。
国际清算银行(BIS)在 2026 年度报告里已经点了名:拿 GPU 做抵押、靠客户租金还贷的结构值得警惕。
| 模型 | 输入 $/MTok | 输出 $/MTok | 缓存 | 这次真正变了什么 |
|---|---|---|---|---|
| GPT-6 AstraOPENAI · 09-03 | 10.00 | 50.00 | 1.00 缓存输入 |
据报道改用循环深度推理;OpenAI 称同任务耗时比 GPT-5.6 Sol 少约 47%,但书面推理更难监控。Fast 档双倍价,batch 与 flex 半价。 |
| Claude Fable 5.1ANTHROPIC · 09-01 | 10.00 | 50.00 | 0.25 缓存读,↓75% |
标价没动,成本从缓存侧降:官方口径典型负载约降 25%,高度 agentic 的负载最多降 45%。同日的 Mythos 5.1 是同一底模的受限档。 |
| Gemini 3.8 FlashGOOGLE · 09-02 | 0.75 | 3.75 | — | 1M 上下文 / 64K 输出,六周内第三次 Flash 发布,基座仍是 3.7 Flash。此价只到 2026-12-31,2027-01-01 起翻倍到 1.50 / 7.50。谷歌自己建议:追求效率就继续留在 3.7。 |
输出价格 · 美元 / 百万 token
同一周发布的三款模型,输出侧差 13 倍。Gemini 的低价带明确的到期日,读这张图时要把 2027 年那根一起看。
7 月 1 日后新建仓库 · 星数前十(已剔除标尺外的 deepseek-harness)
刻度 0 → 28,000 星。这十个里有四个直接属于 harness / 插件生态。
deepseek-ai/deepseek-harness 不在这张图里,因为它是这把尺子的 7.6 倍:214,016 星、25,185 fork,8 月 13 日创建,MIT。画进去会把其余十根压成看不见的线。
这七天里新建且已过 200 星的仓库共 64 个,下面是其中值得点名的几个。
在浏览器里画 Material 3 Expressive 的界面草图,再把草图直接转成给编码 agent 的提示词。「先画后说」这条路径本周被验证得最猛——同榜还有 nateherkai/scroll-craft 这类专做滚动式站点的 agent skill。
官方给出的购物与商户 agent 参考蓝图,带零售、商务、电信、娱乐四组示例。想看「厂商自己认为一个交易型 agent 该长什么样」,这是本周最直接的样本。
开源 3D 人体解剖浏览器:2,234 个可单独选中的 BodyParts3D 网格、系统分层、搜索与爆炸视图。两天冲到一千多星,说明「把一份严肃的公共数据集做成能点开就用的东西」仍然是最短的走红路径。
Tailwind 类名合并与冲突消解的新引擎,用来替掉 tailwind-merge 加 clsx,宣称 API 完全对齐、快 30 倍。只有 10 个 fork——纯工具库的典型形态,星是「记下了」,不是「要改」。
思路是把裁决权从模型手里拿走:模型只负责提议,确定性工具负责判定,每条主张都要对着真实数据留下证据。和本周主线 02(可观测性下降)刚好是一体两面——模型内部越不可读,外部的确定性校验就越值钱。
本周那份费马大定理 Lean 形式化的本体仓库(见时间轴 09/04)。1,300 万行 Lean 代码,可以自己拉下来让 Lean 编译器复核——这是「机器可验证」这四个字最实在的地方。
macOS 小工具,把 Claude Code、Cursor、Codex、Antigravity 四家的用量额度钉在屏幕边缘。同榜还有 damejan80/tokentab(读会话日志算钱,1,160 星)——「编码 agent 花了多少钱」本身已经长出一类工具,这是使用量真的上去了的旁证。
PrimeBot、EngineAI、Dobot、DEEP Robotics、AgiBot、宇树等公司参与。同展会上 MagicLab 展示了部署 VLA(视觉-语言-动作)模型的人形机器人。
官方研究页与配套 PDF 称,Claude 在 Prove2Me 平台上基本自主地工作 11 天,产出费马大定理在 Lean 语言里第一份端到端、计算机可校验的形式化证明。规模:1,300 万行 Lean 代码、30,300 条定理(其中 29,500 条进入最终证明)、约 60 亿输出 token,体量为 Mathlib 的五倍以上。
Prove2Me 的做法是维护一张定理陈述的有向无环图,多个 Claude agent 各自从图里挑当前可解的节点去证,证完把结果交给其他 agent 用——不要求任何一个 agent 记住整份证明。帝国理工的 Kevin Buzzard 复核后称之为「非凡的自动形式化成果」,并说「如果费马大定理的自动形式化现在就可能,那我们朝着自动形式化现代数学文献迈了一大步」。
代码已开源在 anthropics/fermats-last-theorem(9/7 实查 844 星)。
AMD 做开幕主题演讲。D-Robotics 展出 Sunrise AI 芯片族,覆盖 5 至 560 TOPS(INT8),已进入 TCL 的 hey AiMe 陪伴机器人、Vbot 的 SuperDog 四足机器人和 xLean 的 TR1 洗地机器人。
$10 / $50 每百万 token,缓存输入 $1,batch 与 flex 半价,Fast 档双倍——约为 GPT-5.6 Sol 的 2.5 倍价。先向 Daybreak 计划的公司开放,随后进入 ChatGPT Plus / Pro / Business / Enterprise、API、Amazon Bedrock 与 Microsoft Foundry,接口名 gpt-6-astra。
媒体汇总的跑分:OSWorld 2.0 计算机操作 72.6%、单任务耗时比 Sol 少约 47%;FrontierMath Tier 4 97.6%、ExploitBench 100%、ARC-AGI-3 99.9%。这些数字未回官方评测卡核对。
机器人已在小米自家电动车工厂内测试。
六周内第三次 Flash 发布。支持文本、图像、音频、视频、PDF 输入,1M 上下文 / 64K 输出,面向长周期编码与自主 agent 调优。谷歌公布的每一项基准都优于 3.7 Flash,其中三项超过 Claude Opus 5。
但它建在 3.7 Flash 之上而非新底模,靠烧更多思考 token 换分;谷歌自己建议效率优先的负载继续留在 3.7。定价 $0.75 / $3.75 仅到 2026-12-31。
仅见于模型发布追踪站的一行记录,未找到 Meta 官方公告或主流媒体报道。列在这里只为不遗漏,不作为事实引用。
官方称是「世界上最先进的编码与知识工作模型」。Fable 5.1 在低/中 effort 档就能达到或超过 Fable 5,在更高 effort 档进一步提升,多项基准上优于 Fable 5、Opus 5 与 GPT-5.6 Sol。
价格维持 $10 / $50,但缓存输入降到 $0.25 每百万 token——较 Fable 5 降 75%,官方口径下典型负载成本约降 25%,高度 agentic 的负载最多降 45%。Fable 5.1 全面可用(Claude、Claude Code、平台与 Cursor),Mythos 5.1 是同一底模的受限档,只向经审核的网络安全与生命科学机构开放。
星火 X2.5-4B 与 X2.5-1.7B。另据同源报道,通义千问团队 8 月开源了 27B 参数的稠密多模态 Agent 模型。
彭博首报。数据中心位于德州 Nueces County,约 350MW 容量,租约由英伟达持有,比特币矿企 Hut 8 负责建设。这是本周「算力合同债务化」这条线的起点(见主线 04)。
48 页诉状,按每首歌最高 15 万美元索赔。这是上一期(8/30)已记录的那起诉讼的进展,本周的新点在于被告扩展到创始人个人。
Lutnick 在北卡 Chapel Hill 表示该实验室「回到了正确的一边」「做到了我们要求的事」。此前对 Fable 5 与 Mythos 5 短暂实施的出口管制已解除,联邦法官亦裁定五角大楼把 Anthropic 列入黑名单的做法违宪。
原告为加拿大一起校园枪击案的幸存者。OpenAI 对关键指控提出异议。
Claude API 上的 /v1/skills 转正,请求不再需要 beta 头。技能是一个装着说明、脚本与模板的文件夹,只在任务需要时加载,在 Claude 的代码执行沙箱里运行,不需要自己托管。
Figure 与 Nscale 的算力合作从 35 亿美元起、可能超 60 亿,最多 10 万张英伟达 GPU,首批 2027 下半年在德州 Barstow 上线;Crusoe 与 Jane Street 签五年约 130 亿美元云协议;a16z 第五期成长基金 85 亿美元关账,投向企业 AI、机器人与算力栈;Nscale 计划 9 月在美 IPO 募资至多 30 亿;巴西承诺 4.44 亿美元建主权 AI 超算,项目在华为/科大讯飞与英伟达之间分配。
Node.js 实现,开发者预览。它把模型适配器、工具注册表、会话日志、乃至 agent 主循环本身全部做成可替换的插件。这是本周星榜形态的直接成因:星在涨的不是某个 agent 产品,是一套所有人都能往里插东西的接口约定。
违规最高 1,500 万欧元或全球年营业额 3%(取高者)。高风险独立系统(招聘、信贷评分、教育、关键基础设施)的义务推迟至 2027-12-02;嵌入已受监管产品(医疗器械、机械、玩具)的推迟至 2028-08-02。据报道,欧盟 AI 办公室将于 9 月起会同 24 国市场监管机构展开第一轮合规检查——这是本季度最值得盯的执行节点。
转述自国内媒体引用的「全球最大开源模型平台」春季报告,称该比例已超美国居首、主流榜单前五均为中国团队。我没有找到该报告原文,比例与口径未核。方向上与本周开源侧的活跃度一致,但这个具体数字不要引用。
9/7 实查:MoonshotAI/Kimi-K3 8,713 星,MiniMax-AI/MiniMax-H3 8,167 星。两个仓最近一次 push 分别在 8/6 与 8/15——权重仓的星数会停,harness 仓的星数不会,这是主线 03 的另一个侧面。
api.github.com 拿的;「64 个新仓」「13,792 个 dsh-plugin 仓」「3,584 个 agent harness 仓」是搜索接口返回的匹配总数,我没有逐条读过这些仓。三款模型的跑分与官方口径全部来自媒体转述,未回官方评测卡。