本讲目录
第 10 讲 · 模型地图与选型
下篇开篇先解决最高频的问题:这么多模型,干某件活到底该用哪个?本讲给你一张地图和一套选型方法。地图(具体产品名、排位)时效性强,以 2026 年初为快照,会过期;选型方法(维度、试用套路、避坑原则)长期有效——重点吸收后者。
时效声明
模型版本以月为单位更新,本讲提到的具体型号可能已有新版。用前花两分钟核对官网;但"家族气质"(各家的强项传统)变化很慢,地图的骨架可以放心用。
1. 地图:三大国际家族 + 中国梯队
国际三巨头
| 家族 | 厂商 | 家族气质与传统强项 |
|---|---|---|
| GPT / o 系列 | OpenAI | 综合能力均衡的六边形战士;推理系列(o 系)开创测试时计算范式;生态最大、教程最多 |
| Claude 系列 | Anthropic | 写代码与智能体任务的口碑之王(Claude Code);长文写作自然、"人味"足;对齐细腻、拒答边界稳 |
| Gemini 系列 | 原生多模态(图/音/视频)最强;超长上下文(百万级 token)先行者;与 Google 全家桶打通 |
各家产品线通常分三档:旗舰(最强最贵)、主力(性价比平衡,日常默认)、轻量(快而便宜,跑量任务)。同代模型内"贵 ≈ 强"大体成立,但跨用途不成立——写诗不需要旗舰推理模型,那是浪费钱还更慢。
中国梯队
| 家族 | 厂商 | 特点 |
|---|---|---|
| DeepSeek | 深度求索 | 开源旗舰;V 系通用、R 系推理;API 价格极低,性价比标杆;R1 以低成本复现推理能力震动业界 |
| Qwen(通义千问) | 阿里 | 开源谱系最全(0.5B 到百 B 级都有),本地部署首选之一;多模态齐全 |
| Kimi | 月之暗面 | 长文本起家,K 系推理模型开源 |
| GLM | 智谱 | 学术界出身,国内 To B 生态深 |
| 豆包 | 字节 | C 端产品化最强,日活最大 |
中国模型的两个实用意义:便宜(同能力档 API 价格常低一个数量级)与可及(国内网络直连、支付方便;国际模型的官方服务在国内访问受限)。开源权重(DeepSeek/Qwen 等)还意味着可以本地部署——数据不出门(第 11 讲实操)。
推理模型 vs 普通模型:先分清这个
第 07 讲讲过原理(RL 训练的长思维链),选型时这是第一个岔路口:
- 普通(即答)模型:写作、翻译、摘要、聊天、格式转换——响应快、便宜;
- 推理模型:数学、复杂代码调试、多步逻辑、规划——先"思考"几秒到几分钟再回答,贵且慢,但难题正确率高一截。
常见浪费:用推理模型干翻译(慢且无增益);常见翻车:用即答模型做多步数学(第 08 讲:单 token 计算量固定,一步算不完多步题)。难题给推理模型,快活给即答模型,一句话记住。
2. 选型的六个维度
- 能力匹配:任务的瓶颈能力是什么?代码 → 看编程基准与口碑;数学 → 推理系;创作 → 文风口味(主观,必须亲测);
- 上下文长度:要一次读几百页文档?确认窗口够,并记住第 08 讲的警告——标称一百万不等于中间部分真被读进去了(lost in the middle);
- 多模态:要读图、读 PDF 扫描件、听音频吗?
- 价格:API 按 token 计费,输入/输出分开算,推理模型的"思考 token"也收费。跑量任务(批处理十万条数据)价格差一个数量级就是十倍账单;
- 速度:交互场景在乎首 token 延迟,批处理在乎吞吐;
- 部署约束:数据能不能出内网/出境?不能 → 开源模型本地部署或国内合规云。科研数据、商业机密先想这条。
3. 怎么判断"哪个更强":基准的坑
公开基准(MMLU、数学竞赛、SWE-bench 等)可参考,但三个坑要知道:
- 刷榜与污染:基准题目可能混进训练数据(第 01 讲用语:测试集泄漏进训练集),分数系统性虚高;
- 基准 ≠ 你的任务:数学竞赛分数高,不代表给你改中文论文改得好;
- 饱和:老基准大家都 90+ 分,失去区分度。
更可靠的两个信号:竞技场式盲评(如 LMArena:真人盲测两个匿名回答投票,难刷)与你自己的 10 道题——把你真实工作中的典型任务存成一套私人测试题,新模型出来就跑一遍。半小时的亲测胜过读十篇评测文章,这是本讲最值得执行的一条建议。
4. 按场景的推荐配置(2026 年初快照)
| 场景 | 推荐思路 |
|---|---|
| 日常问答/学习 | 任一家主力档即可,重要的是用熟一个、了解它的脾气 |
| 写代码 | Claude 系或 GPT 主力档 + 编程智能体(第 11、15 讲);预算紧用 DeepSeek |
| 数学推导/难题 | 推理模型(o 系 / R 系 / Gemini 思考档),开思维链慢慢算 |
| 论文精读/长文档 | 长上下文强的(Gemini/Kimi/Claude),配合第 13 讲的方法 |
| 批量数据处理 | 轻量档或 DeepSeek——先小样本验证质量,再上量 |
| 敏感数据 | 本地部署开源模型(Qwen/DeepSeek 蒸馏版,第 11 讲实操) |
| 文生图/多模态创作 | 专门模型,见第 16 讲 |
一个被反复验证的使用哲学:主力模型用深,比广撒网强。每个模型有自己的脾气(对指令格式的偏好、拒答的边界、幻觉的高发区),摸熟一个的收益大于浅尝十个。选一个主力 + 一个推理备胎 + 一个便宜跑量的,三件套足够覆盖 95% 的需求。
本讲小结
- 地图会过期,方法不会:能力/上下文/多模态/价格/速度/部署六维度过一遍;
- 推理模型 vs 即答模型是第一岔路:难题上推理,快活上即答;
- 不迷信基准:建一套自己的 10 道测试题,新模型出来跑一遍;
- 三件套配置:主力用深 + 推理备胎 + 便宜跑量。
动手:现在就建你的私人测试题集——从你最近的真实工作里挑 10 个任务(一段要润色的论文、一个要调试的 bug、一道专业题……),存进一个文档。这是你此后每次选型的量尺。
下一讲:选好了模型,怎么把工具链装起来——从零安装到跑通第一个 API 调用和第一个本地模型。