2026年9月是AI史上模型发布最密集的一个月。按 Capital & Compute 的逐条统计,9月共有33个可验证的模型发布,来自14家实验室,其中9个开放权重;单日最高峰出现在9月3日,一天之内7个模型同时上线。9月22日又是另一个高峰:OpenAI 的 GPT-6 Sol 与 Luna、Anthropic 的 Claude Opus 5.5 同日发布;9月28日 Claude Sonnet 5.5 跟进;9月29日 GPT-6.1 Sol 上线。
把日历摊开看,发布并不是均匀发生的,而是“ spikes 加静默周”的形态:一家发,另一家在几小时内回应。这说明头部实验室的竞争焦点已经从“谁的分数高”转向“谁在同样的分数上更便宜”。GPT-6.1 Sol 保持了 GPT-6 Sol 的 2 美元 / 10 美元(每百万 token)定价,但把缓存读取价砍半到 0.10 美元,在 Artificial Analysis 指数上拿到 52 分,只比 Astra 低 1 分,价格却是五分之一。
对做企业应用的人来说,这个信号比任何一个跑分都重要:模型正在变成一种可以按任务计价的商品。既然是商品,选型标准就不该是“最新最强”,而是“在我的任务上,完成一次要花多少钱”。
| 模型 | 发布时间 | 输入/输出(每百万 token) | 定位 |
|---|---|---|---|
| GPT-6 Astra | 9月3日 | $10 / $50 | 旗舰,2M 上下文 |
| GPT-6.1 Sol | 9月29日 | $2 / $10 | 日常编码与智能体 |
| GPT-6 Luna | 9月22日 | $0.10 / $0.50 | 最低档 |
| Claude Opus 5.5 | 9月22日 | $4 / $20 | 旗舰 |
| Claude Sonnet 5.5 | 9月28日 | $2 / $10 | 提速 30%+ |
| DeepSeek V4.1 Flash | 9月10日 | $0.07 / $0.28 | 最便宜档 |
同一张表里,最贵的和最便宜的差了整整两个数量级。而 DeepSeek 做了一个更激进的动作:从 9 月 14 日起,原本调用 V4 Pro 旗舰的请求被默认路由到更便宜的 V4.1 Flash,按 Flash 的价格结算。这意味着“旗舰”这个概念本身正在松动——厂商自己都在判断,多数请求根本用不上旗舰能力。
第一,不要把业务流程焊死在某一个模型上。把调用层抽象出来,用统一接口接两到三家,随时切换。第二,建立自己的评测集:从真实业务里抽 100 到 300 条样本,每次模型换代跑一遍,看完成率和成本的变化,用数据决定要不要切。第三,把省下来的算力预算投到数据整理上——把产品资料、常见问题、历史报价、服务案例整理成结构清晰、可被引用的内容,这才是模型换了几代之后仍然留在你手里的资产。