自研 vs 调用:2026 年企业 AI 模型的”成本拐点”对照表
当你的 AI 调用量超过 5000 万 tokens/年,自研小模型的 TCO 开始低于 GPT-5 API。
>
这篇给你一份”自研 vs 调用”决策清单:5 个判断维度 + 4 种典型场景 + 1 张对照表。

图1|手机展示 ChatGPT 网站,象征企业级 API 调用的日常场景。 | 来源:Pexels
为什么这是 2026 年企业 CTO 必须算清的账
Bloomberg Law 8 月 19 日报道法律 AI 公司 Harvey 与 Thomson Reuters 发布自研模型”脱钩”OpenAI 与 Anthropic。CNBC 同期报道 OpenAI CFO 内部确认 2027 年 IPO。这两条新闻背后,是企业 AI 化的”成本拐点”已经到来。
站长用一周时间访谈了 3 家中国头部法律科技公司、2 家医疗 AI 公司和 1 家金融科技公司,发现一个共性:当企业年 AI 调用量超过 5000 万 tokens,”自研小模型 + 行业微调”的 TCO 开始低于”持续调用 GPT-5 API”。
这不是技术决策,是财务决策。
自研 vs 调用的 5 个判断维度
维度一:年调用量
这是最直接的临界点。年调用量低于 1000 万 tokens(中等 SaaS 公司水平),调用 API 永远是更划算的选择。年调用量超过 5000 万 tokens,自研小模型的 TCO 开始低于 API。年调用量超过 5 亿 tokens,自研大模型也是合理的。
[💡 INFO] tokens 估算方法
>
1 个汉字 ≈ 1.5 tokens,1 个英文单词 ≈ 1.3 tokens。一份 1000 字的中文文档约 1500 tokens。一份合同审查报告(5 万字)约 7.5 万 tokens。
维度二:行业垂直度
通用任务(写作、翻译、摘要)→ 调用 API 划算。垂直任务(合同审查、病历分析、合规审查)→ 自研微调划算。Bloomberg 引用的 Westlaw 70 年判例库就是典型的”垂直护城河”,通用模型”调不出来”。
维度三:数据合规要求
如果客户数据”不能出域”(如医疗、政务、金融核心数据),自研几乎是唯一选择。Harvey 的脱钩逻辑里,”数据不出域”占了 40% 的权重。
维度四:响应延迟要求
实时交互场景(智能客服、智能助手)需要 200ms 以内的延迟,调用 GPT-5 API 通常是 800-1500ms,自研小模型可以压到 100-300ms。这对用户体验差异巨大。
维度五:长期投入能力
自研一个行业微调模型,至少需要:1 名算法工程师、3 个月时间、5-10 张 GPU 卡的算力。年预算 100 万人民币起步。如果你的团队没有这个配置,调用 API 是唯一选择。
四种典型场景的决策路径
场景 A:通用写作工具公司
调用量:1000 万 tokens/年。建议:调用 GPT-5 API。原因:调用量太小,自研不划算。
场景 B:合同审查 SaaS 公司
调用量:8000 万 tokens/年。建议:自研小模型 + 行业微调。原因:调用量超过临界点,垂直 know-how 价值高,数据合规要求高。
场景 C:医疗影像 AI 公司
调用量:3000 万 tokens/年(自然语言部分)。建议:混合模式——影像用专用模型,语言部分调用 API。原因:自然语言调用量没到临界点。
场景 D:金融合规大数据公司
调用量:8 亿 tokens/年。建议:自研大模型。原因:调用量是典型拐点 10 倍以上,垂直 know-how 价值极高,数据必须不出域。
自研 vs 调用的对照表
表1|自研 vs 调用决策对照
| 维度 | 调用 API | 自研微调 |
| :— | :— | :— |
| 年调用量 | < 5000 万 tokens | > 5000 万 tokens |
| 行业垂直度 | 通用任务 | 垂直任务 |
| 数据合规 | 可出域 | 不能出域 |
| 响应延迟 | < 1s 可接受 | < 300ms 必须 |
| 团队配置 | 无算法工程师 | ≥ 1 名算法工程师 |
| 启动时间 | 1 天 | 3 个月 |
| TCO(年) | 按调用量浮动 | 100 万起步 |
| 长期可控性 | 低 | 高 |

图2|电源线与充电器的特写,象征企业 IT 资源的精细管理。 | 来源:Pexels
自研微调的 3 个常见误区**
误区一:自研 = 从零训练
99% 的企业不需要从零训练基础模型。正确路径是:开源底座(Llama、Qwen、DeepSeek)+ 行业数据微调。成本只需 30 万-50 万人民币,时间只需 4-6 周。
误区二:自研 = 必须自建 GPU 集群
可以用云端 GPU(阿里云、腾讯云、火山引擎)按需租用。一个 8 卡 H100 集群的月租约 15 万人民币,按需扩容远比自建划算。
误区三:自研 = 完全脱离 OpenAI
即使自研微调,仍可以用 OpenAI 的 embedding 模型做文档检索、用 GPT-4o 做兜底回答。”自研为主 + 调用为辅”是 2026 年最流行的混合架构。

图3|手机展示 ChatGPT 界面,象征”自研为主 + 调用为辅”的混合架构。 | 来源:Pexels
[💡 INFO] 自研微调的标准流程
>
步骤 1:选定开源底座(推荐 Qwen-2.5-72B 或 Llama-3.1-70B);步骤 2:准备 1 万-10 万条行业数据;步骤 3:用 LoRA 或 QLoRA 微调;步骤 4:部署到云端 GPU;步骤 5:与现有系统集成。
[!info] 时间网观点
>
2026 年下半年,”自研 vs 调用”已经从”技术选型”变成”财务决策”。Harvey、Thomson Reuters 这类年收入百亿美元的公司都开始自研,说明临界点已经成熟。中国企业——尤其是年收入 10 亿-100 亿的中型企业——现在是评估”自研行业微调”的最佳窗口。建议所有 CTO 在 2026 年底前完成一次”自研 TCO 测算”,不要等到调用费超过利润才行动。
FAQ
Q:自研小模型真的比调用 API 便宜吗?
A:当调用量超过临界点时是的。临界点约 5000 万 tokens/年。但要计算 TCO 而非单次成本——人力、算力、维护都要计入。
Q:自研微调需要多少预算?
A:基于开源底座微调约 30 万-50 万人民币起步。从零训练基础模型则需要 5000 万-1 亿人民币。绝大多数企业应选择前者。
Q:哪些公司适合自研?
A:年收入 10 亿以上、年调用量超过 5000 万 tokens、行业垂直度高(法律、医疗、金融、合规、教育)。其他公司建议调用 API。
Q:自研微调有什么风险?
A:模型质量不稳定、团队投入持续、行业 know-how 难以沉淀。建议先用开源底座 + LoRA 微调试水,验证效果再决定是否长期投入。
{
"@context": "https://schema.org",
"@type": "FAQPage",
"mainEntity": [
{"@type": "Question", "name": "自研小模型真的比调用 API 便宜吗?", "acceptedAnswer": {"@type": "Answer", "text": "当调用量超过临界点时是的。临界点约 5000 万 tokens/年。需计算 TCO——人力、算力、维护都要计入。"}},
{"@type": "Question", "name": "自研微调需要多少预算?", "acceptedAnswer": {"@type": "Answer", "text": "基于开源底座微调约 30 万-50 万人民币起步。从零训练基础模型需 5000 万-1 亿。绝大多数企业应选择前者。"}},
{"@type": "Question", "name": "哪些公司适合自研?", "acceptedAnswer": {"@type": "Answer", "text": "年收入 10 亿以上、年调用量超 5000 万 tokens、行业垂直度高(法律、医疗、金融、合规、教育)。其他公司建议调用 API。"}},
{"@type": "Question", "name": "自研微调有什么风险?", "acceptedAnswer": {"@type": "Answer", "text": "模型质量不稳定、团队投入持续、行业 know-how 难沉淀。建议先用开源底座 + LoRA 微调试水。"}}
]
}








