001
关于这几款大模型的参数规模,目前的公开数据如下:
002
Kimi K3:总参数 2.8 万亿,采用混合专家(MoE)架构,每次 Token 处理实际激活约 500 亿参数(激活 896 个专家中的 16 个)。
003
Qwen3:在相关基准测试中披露的版本为 2350 亿总参数,220 亿激活参数(Qwen3-235B-A22B)。
004
GPT-5.6 系列 (Sol, Terra, Luna)、Claude Fable 5 以及 Claude Opus 4.8:OpenAI 和 Anthropic 均未公开具体参数规模,仅被行业统称为“万亿级”巨头。
005
你提到的“苹果/特斯拉与小米”的比喻非常精准。OpenAI 和 Anthropic 绝口不提参数,而 Kimi、Qwen 甚至 DeepSeek 高调宣扬参数规模与架构细节,这本质上是“生态领导者”与“技术追随者”在商业战略上的分化。
007
1. “最强模型”的护城河正在贬值(领导者不再依赖单一指标溢价)
008
过去三年,大模型的商业逻辑是“代差压制”:只要模型足够大、参数足够多,就能形成技术垄断。但到了 2026 年,单纯通过堆叠参数建立的护城河已被无情填平。当 Kimi 这样的开源/半开源追随者能在几个月内通过算法优化(如 KDA 架构、极低精度量化)在代码和综合能力上追平甚至局部反超 GPT-5.6 和 Fable 5 时,参数规模就不再是稀缺资源。
009
因此,OpenAI 在发布 GPT-5.6 时,主叙事从“参数更大”转向了“分层定价(Sol/Terra/Luna)”和价格战。领导者承认了顶级智能正在迅速商品化,单纯标榜参数已无法支撑其品牌溢价。
010
2. 核心壁垒已转移至“业务闭环”与“生态系统”(苹果逻辑)
011
苹果不强调摄像头像素,是因为它的壁垒在于 iOS 生态;OpenAI 和 Anthropic 不强调参数,是因为它们正在把产品做“重”,深入企业工作流。
012
资料指出,OpenAI 将庞大的编程平台 Codex 并入 ChatGPT Work 生态,每周截留数百万活跃用户的真实业务链路;Anthropic 旗下的 Claude Code 将代码编译反馈、系统终端交互包装进自己的闭环管道,并打入金融和制造垂直领域。它们销售的不再是“2.8万亿参数的算力节点”,而是能解决实际问题的 Agent 工作流。在真实业务中的任务定义能力和反馈闭环,远比跑分和参数重要得多。
014
对于 Kimi 或 Qwen 等追随者而言,它们必须高调强调“2.8万亿”、“100万 Token”和“MoE 激活率”。因为在缺乏深厚企业生态壁垒的阶段,公开硬核参数是证明其“已跨入国际第一梯队”的唯一筹码。
015
同时,强调“总参数巨大但激活参数少”,是为了向市场传递极致的“性价比”信号(K3 的 API 价格远低于美国大厂,且私有化部署仅需 1.4TB 显存)。这是一种典型的“以参数透明度换取开发者信任,以高性价比切入市场”的挑战者策略。
017
大模型基座正在彻底“基础设施化”(水电煤化): 开发者不应再对任何单一基座模型产生路径依赖。无论是 2.8 万亿还是闭源巨头,它们的能力差距正在收敛,成本正在暴跌。
018
护城河在应用层,不在模型层: 对开发者而言,最危险的策略就是将自己的核心竞争力建立在“调用某个大模型的 API”上。未来的壁垒在于你是否拥有高价值的“真实工作流数据”。谁能像 Cursor 那样把“任务-反馈-模型-再任务”的流程跑通,用真实的业务反馈去驱动 Agent 系统,谁才能真正抓住这波 AI 红利。资本市场的重估也证明了这一点:市场不再奖励盲目囤积算力的厂商,而是奖励能将算力转化为实际利润和商业闭环的应用生态。