AI 七日情报
9·07

覆盖窗口  2026-08-31 → 09-07
生成于  2026-09-07
主线 4 · 时间轴 15 · 仓 18
已标档条目  A 4 · B 14 · C 4

这七天里,三家前沿实验室在 72 小时内各发了一款模型,两家用的是同一种发布形态;GitHub 上冲得最猛的不是任何一份权重,而是跑权重的壳。下面按「本周的主线 → 模型对照 → GitHub 星榜 → 完整时间轴」排,所有数字都标了来源与证据档位。

这份简报怎么读

GitHub 的星数、fork 数、创建日期是 2026-09-07api.github.com 逐仓实查的快照,属 A 档;模型跑分与融资金额多为媒体转述,属 B 档,我只对影响判断最大的几条回了一手。

凡标 C 的条目不要写进对外材料,它们在这里只是为了说明「这条为什么还不能当事实用」。

A 一手:官方发布 / 接口实查 / 监管原文 B 可靠二手:主流媒体或聚合站,未逐条回核 C 低置信:口径存疑或纯推测
Threads · 按分量排

本周的四条主线

01

三家在 72 小时里各发一款模型,其中两家发的是「一模两档」

9/1 Anthropic 同时放出 Claude Fable 5.1 与 Mythos 5.1——同一个底模,两套护栏:Fable 5.1 面向所有人,Mythos 5.1 只向经审核的网络安全与生命科学机构开放。9/2 Google 的 Gemini 3.8 Flash 也带了一个锁死的兄弟版 3.8 Flash Cyber。9/3 OpenAI 发 GPT-6 Astra,先给 Daybreak 计划的公司,随后才到 Plus / Pro / Business / Enterprise 与 API。

把「高危能力」从通用产品里切出去、单独走审核发放,这一周成了三家里两家的默认动作,而不是个别选择。

值得注意的是 这意味着「最强的那档模型」和「你能买到的那档模型」正在分开定价、分开发放。评估厂商能力时,跑分榜上那一行未必是你付费能调到的那一个。
02

能力继续往上,可观测性第一次公开地往下

据报道,GPT-6 Astra 用的是 recurrent depth(循环深度 / 循环 transformer):同一批 token 在同一组层里反复过多轮,在潜空间里推理,而不是把思考过程写成自然语言。效率上去了,代价是留下的链式思维记录变少

OpenAI 自己说,在「明确要求模型规避监控」的评测里,Astra 的书面推理比 GPT-5.6 Sol 更难监控。这是厂商第一次把「新架构降低了可监控性」写进自己的发布材料。

档位提醒 「Astra = recurrent depth」目前是媒体报道,不是 OpenAI 的架构披露C);「自评更难监控」出自 OpenAI 自己的说明(B)。两句话的可信度差一档,别合并成一句话讲。
03

GitHub 上最火的不是权重,是跑权重的壳

DeepSeek 8 月 13 日以 MIT 开源的 deepseek-harness(「万物皆插件」),到 9 月 7 日已经 214,016 星 / 25,185 fork——这个量级在开源史上极罕见。围着它长出来的生态同样在榜上:桌面端 dsh-desktop 23,956 星、插件精选清单 14,669 星,带 dsh-plugin 话题的仓库有 13,792 个

同期上榜的 xai-org/grok-build(26,520)、yc-software/qm(14,634)、truefoundry/trueforge(5,268)在自我描述里全都用了同一个词:agent harness。7 月 1 日之后新建、名称或简介里出现这个词的仓库有 3,584 个

值得注意的是 竞争位置在下移:模型层已经是少数几家的资本游戏,而「谁的壳跑得顺、插件多、能换模型」是开源社区还能赢的一层。挑工具链时,优先看它换模型的成本,而不是它现在绑的是谁。
04

算力合同开始由债务和租约结构承载,而不是营收

8/31 起的一周里:Anthropic 与英伟达投资的 Lambda 敲定六年、350 亿美元云算力协议,数据中心在德州 Nueces County、约 350MW,租约由英伟达持有、由比特币矿企 Hut 8 建设;博通正在寻求 600 亿美元以上的 AI 芯片相关债务融资,Apollo 与 Blackstone 参与,Anthropic 是锚定租户;人形机器人公司 Figure 与 Nscale 签下 35 亿美元起、可能超 60 亿的算力承诺,最多 10 万张英伟达 GPU;Crusoe 与 Jane Street 签五年约 130 亿美元;a16z 第五期成长基金 85 亿美元关账;Nscale 计划 9 月在美 IPO 募资至多 30 亿。

国际清算银行(BIS)在 2026 年度报告里已经点了名:拿 GPU 做抵押、靠客户租金还贷的结构值得警惕。

值得注意的是 这些是六年期合同,不是季度支出。它决定的是 2027–2032 年推理价格的底——短期看,供给不紧张、单位成本大概率继续下行;中期看,这条链上任何一环的租金违约都会同时传导到芯片、电力和云三个市场。
Models · 09-01 → 09-03

三款新模型,摆在一起看

模型 输入 $/MTok 输出 $/MTok 缓存 这次真正变了什么
GPT-6 AstraOPENAI · 09-03 10.00 50.00 1.00
缓存输入
据报道改用循环深度推理;OpenAI 称同任务耗时比 GPT-5.6 Sol 少约 47%,但书面推理更难监控。Fast 档双倍价,batch 与 flex 半价。
Claude Fable 5.1ANTHROPIC · 09-01 10.00 50.00 0.25
缓存读,↓75%
标价没动,成本从缓存侧降:官方口径典型负载约降 25%,高度 agentic 的负载最多降 45%。同日的 Mythos 5.1 是同一底模的受限档。
Gemini 3.8 FlashGOOGLE · 09-02 0.75 3.75 1M 上下文 / 64K 输出,六周内第三次 Flash 发布,基座仍是 3.7 Flash。此价只到 2026-12-31,2027-01-01 起翻倍到 1.50 / 7.50。谷歌自己建议:追求效率就继续留在 3.7。

输出价格 · 美元 / 百万 token

同一周发布的三款模型,输出侧差 13 倍。Gemini 的低价带明确的到期日,读这张图时要把 2027 年那根一起看。

GPT-6 Astra $50.00
Claude Fable 5.1 $50.00
Gemini 3.8 Flash 今年内 $3.75
Gemini 3.8 Flash 2027 起 $7.50
012.52537.550
GitHub · 09-07 实查

星榜:本周新开的,和两个月内冲得最猛的

7 月 1 日后新建仓库 · 星数前十(已剔除标尺外的 deepseek-harness)

刻度 0 → 28,000 星。这十个里有四个直接属于 harness / 插件生态。

JustVugg/colibri26,958
xai-org/grok-build26,520
anywhere-labs/dsh-desktop23,956
firecrawl/anydoc20,540
andrewyng/openworker17,400
img2threejs/img2threejs15,393
awesome-dsh-plugin14,669
yc-software/qm14,634
FlashML-org/FreeToken11,877
openai/codex-security10,540
07k14k21k28k

deepseek-ai/deepseek-harness 不在这张图里,因为它是这把尺子的 7.6 倍214,016 星、25,185 fork,8 月 13 日创建,MIT。画进去会把其余十根压成看不见的线。

本周(08-31 → 09-07)新开的仓

这七天里新建且已过 200 星的仓库共 64 个,下面是其中值得点名的几个。

4,282

lnkiai/m3e-canvas

在浏览器里画 Material 3 Expressive 的界面草图,再把草图直接转成给编码 agent 的提示词。「先画后说」这条路径本周被验证得最猛——同榜还有 nateherkai/scroll-craft 这类专做滚动式站点的 agent skill。

TypeScriptMIT09-02 创建368 fork
2,213

anthropics/commerce-agents

官方给出的购物与商户 agent 参考蓝图,带零售、商务、电信、娱乐四组示例。想看「厂商自己认为一个交易型 agent 该长什么样」,这是本周最直接的样本。

PythonApache-2.009-01 创建379 fork
1,355

ashemag/human-atlas

开源 3D 人体解剖浏览器:2,234 个可单独选中的 BodyParts3D 网格、系统分层、搜索与爆炸视图。两天冲到一千多星,说明「把一份严肃的公共数据集做成能点开就用的东西」仍然是最短的走红路径。

TypeScriptMIT09-05 创建353 fork
1,213

shadcn-ui/cn

Tailwind 类名合并与冲突消解的新引擎,用来替掉 tailwind-merge 加 clsx,宣称 API 完全对齐、快 30 倍。只有 10 个 fork——纯工具库的典型形态,星是「记下了」,不是「要改」。

TypeScriptMIT08-31 创建10 fork
966

2akouwu/reverify

思路是把裁决权从模型手里拿走:模型只负责提议,确定性工具负责判定,每条主张都要对着真实数据留下证据。和本周主线 02(可观测性下降)刚好是一体两面——模型内部越不可读,外部的确定性校验就越值钱。

Python08-31 创建208 fork
844

anthropics/fermats-last-theorem

本周那份费马大定理 Lean 形式化的本体仓库(见时间轴 09/04)。1,300 万行 Lean 代码,可以自己拉下来让 Lean 编译器复核——这是「机器可验证」这四个字最实在的地方。

Lean09-04 创建71 fork
699

vinzdg/codenotch

macOS 小工具,把 Claude Code、Cursor、Codex、Antigravity 四家的用量额度钉在屏幕边缘。同榜还有 damejan80/tokentab(读会话日志算钱,1,160 星)——「编码 agent 花了多少钱」本身已经长出一类工具,这是使用量真的上去了的旁证。

Swift09-05 创建33 fork
读星榜的一条纪律:先看 fork / star 的比值。 正常项目大致在 0.05–0.20(deepseek-harness 0.12、colibri 0.11、shadcn-ui/cn 0.008)。本周新仓里有 star 1,036 / fork 1,125、star 516 / fork 757 这样比值大于 1 的——fork 比 star 还多不是自然形态,是刷量农场的典型签名。这类仓在任何「趋势榜」上都会照常出现,页面里没有收录它们。
Timeline · 倒序

本周完整条目

09 / 05FRI
B

11 家机器人公司的人形与四足机器人走上 IFA 秀场

PrimeBot、EngineAI、Dobot、DEEP Robotics、AgiBot、宇树等公司参与。同展会上 MagicLab 展示了部署 VLA(视觉-语言-动作)模型的人形机器人。

机器人ifa-berlin.com · techtimes
09 / 04THU
A

Anthropic:Claude 用 11 天自主完成费马大定理的机器可验证证明

官方研究页与配套 PDF 称,Claude 在 Prove2Me 平台上基本自主地工作 11 天,产出费马大定理在 Lean 语言里第一份端到端、计算机可校验的形式化证明。规模:1,300 万行 Lean 代码、30,300 条定理(其中 29,500 条进入最终证明)、约 60 亿输出 token,体量为 Mathlib 的五倍以上。

Prove2Me 的做法是维护一张定理陈述的有向无环图,多个 Claude agent 各自从图里挑当前可解的节点去证,证完把结果交给其他 agent 用——不要求任何一个 agent 记住整份证明。帝国理工的 Kevin Buzzard 复核后称之为「非凡的自动形式化成果」,并说「如果费马大定理的自动形式化现在就可能,那我们朝着自动形式化现代数学文献迈了一大步」。

代码已开源在 anthropics/fermats-last-theorem(9/7 实查 844 星)。

研究本周最重anthropic.com/research · siliconangle
B

IFA 2026 开幕:102 年来首次由芯片公司开场

AMD 做开幕主题演讲。D-Robotics 展出 Sunrise AI 芯片族,覆盖 5 至 560 TOPS(INT8),已进入 TCL 的 hey AiMe 陪伴机器人、Vbot 的 SuperDog 四足机器人和 xLean 的 TR1 洗地机器人。

硬件prnewswire · techtimes
09 / 03WED
B

OpenAI 发布 GPT-6 Astra

$10 / $50 每百万 token,缓存输入 $1,batch 与 flex 半价,Fast 档双倍——约为 GPT-5.6 Sol 的 2.5 倍价。先向 Daybreak 计划的公司开放,随后进入 ChatGPT Plus / Pro / Business / Enterprise、API、Amazon Bedrock 与 Microsoft Foundry,接口名 gpt-6-astra

媒体汇总的跑分:OSWorld 2.0 计算机操作 72.6%、单任务耗时比 Sol 少约 47%;FrontierMath Tier 4 97.6%、ExploitBench 100%、ARC-AGI-3 99.9%。这些数字未回官方评测卡核对。

模型跑分未回核openrouter · datacamp · implicator.ai
B

小米 IFA 首秀:CyberOne 人形机器人 + 自研 3nm 处理器 XRing O3

机器人已在小米自家电动车工厂内测试。

机器人硬件sedaily · sbs
09 / 02TUE
B

Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

六周内第三次 Flash 发布。支持文本、图像、音频、视频、PDF 输入,1M 上下文 / 64K 输出,面向长周期编码与自主 agent 调优。谷歌公布的每一项基准都优于 3.7 Flash,其中三项超过 Claude Opus 5。

但它建在 3.7 Flash 之上而非新底模,靠烧更多思考 token 换分;谷歌自己建议效率优先的负载继续留在 3.7。定价 $0.75 / $3.75 仅到 2026-12-31

模型theregister · 9to5google
C

同晚 Meta 发布 Muse Spark 1.3

仅见于模型发布追踪站的一行记录,未找到 Meta 官方公告或主流媒体报道。列在这里只为不遗漏,不作为事实引用。

低置信llmgateway.io 等追踪站
09 / 01MON
A

Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1

官方称是「世界上最先进的编码与知识工作模型」。Fable 5.1 在低/中 effort 档就能达到或超过 Fable 5,在更高 effort 档进一步提升,多项基准上优于 Fable 5、Opus 5 与 GPT-5.6 Sol。

价格维持 $10 / $50,但缓存输入降到 $0.25 每百万 token——较 Fable 5 降 75%,官方口径下典型负载成本约降 25%,高度 agentic 的负载最多降 45%。Fable 5.1 全面可用(Claude、Claude Code、平台与 Cursor),Mythos 5.1 是同一底模的受限档,只向经审核的网络安全与生命科学机构开放。

模型成本sdtimes · venturebeat · platform.claude.com
B

科大讯飞旗下开源两款端侧通用模型

星火 X2.5-4B 与 X2.5-1.7B。另据同源报道,通义千问团队 8 月开源了 27B 参数的稠密多模态 Agent 模型。

开源中国腾讯云开发者社区 · 数字中国
08 / 31SUN
B

Anthropic 与英伟达投资的 Lambda 敲定 350 亿美元、六年云算力协议

彭博首报。数据中心位于德州 Nueces County,约 350MW 容量,租约由英伟达持有,比特币矿企 Hut 8 负责建设。这是本周「算力合同债务化」这条线的起点(见主线 04)。

算力资本bloomberg · thetechcapital
本周内日期未精确到日
B

索尼音乐版权与华纳查普尔的诉状点名 Anthropic 创始人个人

48 页诉状,按每首歌最高 15 万美元索赔。这是上一期(8/30)已记录的那起诉讼的进展,本周的新点在于被告扩展到创始人个人

法律aiweekly.co
B

美商务部长在 G20 创新部长会上称政府信任 Anthropic

Lutnick 在北卡 Chapel Hill 表示该实验室「回到了正确的一边」「做到了我们要求的事」。此前对 Fable 5 与 Mythos 5 短暂实施的出口管制已解除,联邦法官亦裁定五角大楼把 Anthropic 列入黑名单的做法违宪。

政策aiweekly.co
B

30 起新诉状指 OpenAI 未向警方预警

原告为加拿大一起校园枪击案的幸存者。OpenAI 对关键指控提出异议。

法律aiweekly.co
B

Agent Skills 与 Skills API 结束 beta

Claude API 上的 /v1/skills 转正,请求不再需要 beta 头。技能是一个装着说明、脚本与模板的文件夹,只在任务需要时加载,在 Claude 的代码执行沙箱里运行,不需要自己托管。

开发者releasebot.io · 官方更新日志
B

算力与资本:Figure、Crusoe、a16z、Nscale、巴西

Figure 与 Nscale 的算力合作从 35 亿美元起、可能超 60 亿,最多 10 万张英伟达 GPU,首批 2027 下半年在德州 Barstow 上线;Crusoe 与 Jane Street 签五年约 130 亿美元云协议;a16z 第五期成长基金 85 亿美元关账,投向企业 AI、机器人与算力栈;Nscale 计划 9 月在美 IPO 募资至多 30 亿;巴西承诺 4.44 亿美元建主权 AI 超算,项目在华为/科大讯飞与英伟达之间分配。

算力资本techstartups · newmarketpitch
Context · 非本周

不在这七天里,但决定了怎么读这七天

08 / 13

DeepSeek Harness 以 MIT 开源A

Node.js 实现,开发者预览。它把模型适配器、工具注册表、会话日志、乃至 agent 主循环本身全部做成可替换的插件。这是本周星榜形态的直接成因:星在涨的不是某个 agent 产品,是一套所有人都能往里插东西的接口约定。

08 / 02

欧盟《AI 法案》第 50 条透明度义务生效B

违规最高 1,500 万欧元或全球年营业额 3%(取高者)。高风险独立系统(招聘、信贷评分、教育、关键基础设施)的义务推迟至 2027-12-02;嵌入已受监管产品(医疗器械、机械、玩具)的推迟至 2028-08-02。据报道,欧盟 AI 办公室将于 9 月起会同 24 国市场监管机构展开第一轮合规检查——这是本季度最值得盯的执行节点。

2026 春

中国开源模型占全球下载量 41%C

转述自国内媒体引用的「全球最大开源模型平台」春季报告,称该比例已超美国居首、主流榜单前五均为中国团队。我没有找到该报告原文,比例与口径未核。方向上与本周开源侧的活跃度一致,但这个具体数字不要引用。

07 / 27 · 07 / 30

Kimi K3 与 MiniMax-H3 的开放权重仍在榜上A

9/7 实查:MoonshotAI/Kimi-K3 8,713 星,MiniMax-AI/MiniMax-H3 8,167 星。两个仓最近一次 push 分别在 8/6 与 8/15——权重仓的星数会停,harness 仓的星数不会,这是主线 03 的另一个侧面。

Caveats

这份简报的检索局限

  • GitHub 数字是 A 档,模型跑分不是。星数、fork、创建日期、语言、许可证是 2026-09-07 逐仓打 api.github.com 拿的;「64 个新仓」「13,792 个 dsh-plugin 仓」「3,584 个 agent harness 仓」是搜索接口返回的匹配总数,我没有逐条读过这些仓。三款模型的跑分与官方口径全部来自媒体转述,未回官方评测卡。
  • 时间轴的日期以来源标注为准,且有一组没有精确到日。诉讼、G20 表态、Skills API 转正这几条只查到「本周内」,已单独归为一组,没有硬派一个日期上去。
  • 中国侧覆盖仍然偏薄。检索走美国节点,国内动态很可能有遗漏;页面里的国产模型条目主要是端侧开源与权重仓星数,不构成对国内这一周的完整覆盖。
  • 星数不是质量。它衡量的是关注度和传播效率。本页只做了 fork/star 比值这一道最粗的筛,没有读代码、没有跑,也没有查提交历史真伪。
  • 「值得注意的是」是判断,不是事实。四条主线里的推论部分来自我对这些公开信息的解读,采信前请回一手源自己看一遍。