本讲目录

第 10 讲 · 模型地图与选型

下篇开篇先解决最高频的问题:这么多模型,干某件活到底该用哪个?本讲给你一张地图和一套选型方法。地图(具体产品名、排位)时效性强,以 2026 年初为快照,会过期;选型方法(维度、试用套路、避坑原则)长期有效——重点吸收后者。

时效声明

模型版本以月为单位更新,本讲提到的具体型号可能已有新版。用前花两分钟核对官网;但"家族气质"(各家的强项传统)变化很慢,地图的骨架可以放心用。

1. 地图:三大国际家族 + 中国梯队

国际三巨头

家族 厂商 家族气质与传统强项
GPT / o 系列 OpenAI 综合能力均衡的六边形战士;推理系列(o 系)开创测试时计算范式;生态最大、教程最多
Claude 系列 Anthropic 写代码与智能体任务的口碑之王(Claude Code);长文写作自然、"人味"足;对齐细腻、拒答边界稳
Gemini 系列 Google 原生多模态(图/音/视频)最强;超长上下文(百万级 token)先行者;与 Google 全家桶打通

各家产品线通常分三档:旗舰(最强最贵)、主力(性价比平衡,日常默认)、轻量(快而便宜,跑量任务)。同代模型内"贵 ≈ 强"大体成立,但跨用途不成立——写诗不需要旗舰推理模型,那是浪费钱还更慢。

中国梯队

家族 厂商 特点
DeepSeek 深度求索 开源旗舰;V 系通用、R 系推理;API 价格极低,性价比标杆;R1 以低成本复现推理能力震动业界
Qwen(通义千问) 阿里 开源谱系最全(0.5B 到百 B 级都有),本地部署首选之一;多模态齐全
Kimi 月之暗面 长文本起家,K 系推理模型开源
GLM 智谱 学术界出身,国内 To B 生态深
豆包 字节 C 端产品化最强,日活最大

中国模型的两个实用意义:便宜(同能力档 API 价格常低一个数量级)与可及(国内网络直连、支付方便;国际模型的官方服务在国内访问受限)。开源权重(DeepSeek/Qwen 等)还意味着可以本地部署——数据不出门(第 11 讲实操)。

推理模型 vs 普通模型:先分清这个

第 07 讲讲过原理(RL 训练的长思维链),选型时这是第一个岔路口:

常见浪费:用推理模型干翻译(慢且无增益);常见翻车:用即答模型做多步数学(第 08 讲:单 token 计算量固定,一步算不完多步题)。难题给推理模型,快活给即答模型,一句话记住。

2. 选型的六个维度

  1. 能力匹配:任务的瓶颈能力是什么?代码 → 看编程基准与口碑;数学 → 推理系;创作 → 文风口味(主观,必须亲测);
  2. 上下文长度:要一次读几百页文档?确认窗口够,并记住第 08 讲的警告——标称一百万不等于中间部分真被读进去了(lost in the middle);
  3. 多模态:要读图、读 PDF 扫描件、听音频吗?
  4. 价格:API 按 token 计费,输入/输出分开算,推理模型的"思考 token"也收费。跑量任务(批处理十万条数据)价格差一个数量级就是十倍账单;
  5. 速度:交互场景在乎首 token 延迟,批处理在乎吞吐;
  6. 部署约束:数据能不能出内网/出境?不能 → 开源模型本地部署或国内合规云。科研数据、商业机密先想这条。

3. 怎么判断"哪个更强":基准的坑

公开基准(MMLU、数学竞赛、SWE-bench 等)可参考,但三个坑要知道:

更可靠的两个信号:竞技场式盲评(如 LMArena:真人盲测两个匿名回答投票,难刷)与你自己的 10 道题——把你真实工作中的典型任务存成一套私人测试题,新模型出来就跑一遍。半小时的亲测胜过读十篇评测文章,这是本讲最值得执行的一条建议。

4. 按场景的推荐配置(2026 年初快照)

场景 推荐思路
日常问答/学习 任一家主力档即可,重要的是用熟一个、了解它的脾气
写代码 Claude 系或 GPT 主力档 + 编程智能体(第 11、15 讲);预算紧用 DeepSeek
数学推导/难题 推理模型(o 系 / R 系 / Gemini 思考档),开思维链慢慢算
论文精读/长文档 长上下文强的(Gemini/Kimi/Claude),配合第 13 讲的方法
批量数据处理 轻量档或 DeepSeek——先小样本验证质量,再上量
敏感数据 本地部署开源模型(Qwen/DeepSeek 蒸馏版,第 11 讲实操)
文生图/多模态创作 专门模型,见第 16 讲

一个被反复验证的使用哲学:主力模型用深,比广撒网强。每个模型有自己的脾气(对指令格式的偏好、拒答的边界、幻觉的高发区),摸熟一个的收益大于浅尝十个。选一个主力 + 一个推理备胎 + 一个便宜跑量的,三件套足够覆盖 95% 的需求。

本讲小结

动手:现在就建你的私人测试题集——从你最近的真实工作里挑 10 个任务(一段要润色的论文、一个要调试的 bug、一道专业题……),存进一个文档。这是你此后每次选型的量尺。


下一讲:选好了模型,怎么把工具链装起来——从零安装到跑通第一个 API 调用和第一个本地模型。