行业趋势7 分钟阅读

豆包 1.4 亿日活,用的却不是最强模型:模型本身,还是竞争壁垒吗?

DeepSeek V4 刚发布。1.6 万亿参数,百万上下文,API 价格是美国同级模型的 1/6。每次出这种事,都会掀起一轮"中美 AI 谁更强"的讨论。

这也引起我的思考。中美 AI 的竞争优势到底在哪里?各自的短期、长期优势究竟是什么?未来会往什么方向演变? 关于该问题,不是一篇短文就能讲清楚,我希望分篇发布,这是系列文章的第一篇。

这一篇,先探讨一个前置问题:模型本身,还是竞争壁垒吗?

一个神奇的事实

2026 年 3 月,豆包 MAU 3.45 亿,DAU 约 1.4 亿(据 QuestMobile 数据)。第二名千问 MAU 1.66 亿,第三名 DeepSeek 1.27 亿——豆包大于第二名加第三名之和。字节内部的说法是,豆包是"字节历史上所有破亿产品中获客成本最低的"。

中国AI应用月活排行(2026Q1)——豆包3.45亿断层领先,数据来源QuestMobile
中国AI应用月活排行(2026Q1)——豆包3.45亿断层领先,数据来源QuestMobile

但豆包的底层模型不是 SOTA(State of the Art,最强模型)。跟 Claude Opus、GPT-5.5 比,性能差距不小。

中国最成功的 AI 应用,不需要最强的模型,这是为什么呢?

大部分场景,不需要最强模型

NVIDIA Research 2025 年 6 月论文的判断:10B 参数以下的小模型,可以有效处理 60-80% 当前分配给 70B 以上通用大模型的 AI Agent 任务。推理成本低 10-30 倍。Gartner 2025 年 4 月预测:到 2027 年,企业使用小型任务特定模型的量,将至少是通用大模型的 3 倍

此外,专用小模型在特定任务上已经可以匹配甚至超越前沿大模型。

举例来说,AI 公司 Parsed 微调了一个 27B 参数的 Gemma 3 模型做医疗临床记录,微调后比前沿模型 Claude Sonnet 4 高 60%,推理成本低 10-100 倍。

aiXcoder 用一个 4B 参数的专用模型做代码变更,准确率 93.8%,超过 671B 的 DeepSeek-V3.2(92.5%),算力成本只有后者的 5%。

Cursor 从完全依赖 OpenAI/Anthropic 的 API,转向自研专用编码模型,企业版业务实现了正毛利,而此前全部依赖大模型 API 时是亏损的。

核心机制很清晰:任务越窄,微调小模型的"每参数效率"越高——全部参数集中在一个更窄的概率空间上,使得在特定任务上,能取得更优的成本表现。一个精心微调的中端模型,经常胜过 prompt 写得一般的前沿模型。

"够用"的能力也越来越便宜

不只是专用小模型能替代前沿大模型,达到同等推理能力所需的成本,也在飞速下降。

以 GPT-4 为例,这是一个在大部分日常场景下已经表现良好的模型。2023 年 3 月发布时,API 定价是 $30/$60 每百万 token(输入/输出)。仅 16 个月后的 GPT-4o mini,在多数日常任务上表现接近 GPT-4,价格却便宜了 100 多倍。再过 5 个月,DeepSeek-V3 和 Gemini 2.0 Flash 在多数基准上达到甚至超越 GPT-4,价格仅为原价的 1/200(据 a16z 分析及各厂商官方定价)。

虽然每代最新的前沿模型(Claude Opus、GPT-5)定价基本没有下降,但同等模型能力的价格,以令人震惊的速度在下降。

GPT-4级别推理能力的获取成本变化——21个月内从$30-60/百万token降至$0.1-0.3,降幅超过200倍。数据来源a16z LLMflation分析及各厂商官方定价
GPT-4级别推理能力的获取成本变化——21个月内从$30-60/百万token降至$0.1-0.3,降幅超过200倍。数据来源a16z LLMflation分析及各厂商官方定价

甚至"更强"也需要取舍

即使在 SOTA 内部,"更强"也不再是一个简单的事。

Anthropic 最近把 Claude Opus 从 4.6 升级到 4.7。从评测分数看,编程能力确实涨了,SWE-bench 提了 10 个百分点,然而,其长文本检索能力从 78.3% 暴跌到 32.2%,实际使用成本也涨了约 50%。

社区反应也很说明问题,Reddit 上一篇"Opus 4.7 是严重退步"的帖子拿了 2300 多赞。X 上类似的帖子 1.4 万赞。知名科技博客 The Pragmatic Engineer(主要面向软件工程师群体,在欧美开发者圈影响力很大)的作者试用后直接退回 4.6。

4.7 不是不好——编程和视觉任务上它确实更强。但这种升级说明一件事:当模型能力到了一定水平之后,可能就不存在"全面更强",而是"在 A 上更好,在 B 上更差"。

对大部分用户来说,4.6 已经够用,甚至更好用。就我个人体感而言,4.6 确实比 4.7 好用,我现在也是退回 4.6 使用的。

那竞争在哪里?

综上,模型在绝大部分常见场景中,已经够用,甚至「非常够用」了,再提升模型能力,收益递减。

在这些场景中,模型确实不是决定性因素。豆包拥有 1.4 亿 DAU,赢过千问和 DeepSeek,靠的不是模型性能,是字节系的流量入口、低门槛的产品设计、免费或极低价的使用成本。分发能力、产品体验、场景覆盖。

a16z 统计的全球 AI 产品 Top 50 中,中国产品从 24 年的个位数增长到 25 年的约 20 款,占比接近四成。这些产品覆盖了聊天、搜索、图像、视频、编程等各个方向,但它们的增长故事有一个共同特征——没有一个是靠模型性能领先赢的。在我看来,它们更多依赖于激进的定价、更好用的产品设计、和更强的分发能力。

如果文章到这里结束,结论就很简单:模型不再是壁垒,分发和产品才是。

一个仍然悬而未决的问题

但没有这么简单。

"够用"场景正在快速同质化。豆包免费、千问补贴、DeepSeek 的 API 价格是 GPT-4 发布时的 1/200——当所有人都在打价格战的时候,这个市场的利润空间在被迅速压缩。赢了用户,不等于赢了利润。

与此同时,AI 市场中增长最快的收入并不在这些日常对话场景中。据 Menlo Ventures 统计,AI 编程工具市场 2025 年同比增长超过 7 倍(从 5.5 亿美元到 40 亿美元)。Anthropic 的年收入反超了 OpenAI(据 Bloomberg,2026 年 4 月)——而它几乎没有消费级用户。

到这里,有一件事是清楚的,还有一件事不太清楚。

清楚的是:在模型够用的场景中,模型本身确实不再是壁垒——分发、产品、价格决定胜负。

不清楚的是:这个场景的商业价值有多大。价格战正在压缩利润空间,而当下,AI 市场中增长最快的收入发生在别处。赢下"够用"这个战场,有没有可能是在争一块正在缩水的蛋糕?

下一篇,我希望看看 AI 的利润,究竟如何分布,如何变化。将是系列文章的第二篇,到系列末篇,将所有论据整合起来,回答开头的问题。


参考来源:

  1. QuestMobile,《2026年一季度中国AI应用洞察报告》,2026年4月
  2. NVIDIA Research,"Small Language Models are the Future of Agentic AI"(arXiv: 2506.02153),Peter Belcak et al.,2025年6月
  3. Gartner Newsroom,"Gartner Predicts by 2027, Organizations Will Use Small, Task-Specific AI Models Three Times More Than General-Purpose Large Language Models",2025年4月
  4. a16z,"Welcome to LLMflation — LLM Inference Cost Is Going Down Fast",Guido Appenzeller,2024年11月
  5. a16z,"The Top 100 Gen AI Consumer Apps"第五版,Olivia Moore,2025年8月
  6. Parsed,"Fine-tuning Small Open-Source LLMs to Outperform Large Closed-Source Models by 60% on Specialized Tasks",2025年8月
  7. Bloomberg,"Anthropic Tops $30 Billion Run Rate",2026年4月
  8. Menlo Ventures,"2025 The State of Generative AI in the Enterprise",2025年12月
#AI竞争#模型#中美AI