"总参数大、激活参数小"——把参数拆成专家模块,每处理一个词元只唤醒一小撮,其余休眠。
| 模型 | 总参数 | 激活参数 | 专家数 / 每次激活 | 激活占比 |
|---|---|---|---|---|
| Kimi K3 | 2.8T | 104B | 896 / 16 | 3.7% |
| Qwen 3.8-Max | 2.4T | 95B | 512 / 10 + 1 共享 | 4.0% |
| Qwen 3.8-Flash | 125B | 6B | 512 / 10 + 1 共享 | 4.8% |
| DeepSeek V4 Pro | 1.6T | 49B | 细粒度切分 | 3.1% |
| DeepSeek V4-Flash | 284B / 13B 激活、256 专家(6 路由 + 1 共享)、43 层、原生 1M——架构与 V4 Pro 同系(轻量档),见 1.6 小节 | |||
| GLM-5.3 | 743B | 40B | 未公布 | 5.4% |
| GLM-5.3-Flash | 320B | 18B | 未公布 | 5.6% |
| 混元 Hy4 preview | 770B | 49B | 未公布 | 6.4% |
| 混元 Hy3 | 295B | 21B | 192 / 8 | 7.1% |
| GPT-5.6 系 | 架构未公开 [UNVERIFIED],见产品层 Agent loop 示意 | |||
| Claude Opus/Sonnet | 架构未公开 [UNVERIFIED],见产品层 Agent loop 示意 | |||
| Gemini 3.1 Pro | 架构未公布(Google 惯例不披露细节)[UNVERIFIED];2M 上下文、原生多模态(文本/图像/视频/音频/PDF 输入);Gemini 3.6 Flash 为同系轻量档 | |||
| Grok 4 | 架构未公布 [UNVERIFIED];256K 上下文、多模态输入 + 工具调用 + 上下文缓存;Grok 4.1 Thinking 同价思考档 | |||
| Ling-3.0-Flash | 124B | 5.1B | 未公布 | ~4.1% [COMPUTED] |
| MiniMax-M3 | 428B(官方口径) | 23B | 未公布(MSA 稀疏注意力) | 5.4% |
| 豆包 Seed 2.1 Turbo | 架构未公开、闭源 API-only,无开源权重 [KNOWN] | |||
官方原话:"Scaling post-training is all we did"——743B 基座与 5.2 完全相同,全部提升来自后训练。
| 技术点 | 白话解释 | 解决什么问题 |
|---|---|---|
| 基座冻结 | 743B 与 5.2 完全一致,零改动 | 证明提升 100% 来自后训练 |
| 后训练三支柱 | 任务环境规模化 + 多样化 + 训练时长延长 | 给 RL 提供海量可验证反馈 |
| Slime RL + IndexShare + SAO | 自研 RL 基建,跨任务共享经验 | 降低 RL 训练成本 |
| 裁判 Agent + 轨迹反查 | 自动验证答案并反查是否钻奖励空子 | 防 reward hacking |
| 训练-推演一致性 1e-7 | 训练与推理 log-prob 误差千万分之一 | 上线策略不跑偏 |
| GLM-5.3-Flash(并入本节) | 轻量档,沿用同一后训练体系,架构与 5.3 相同(320B/18B,08-28 官方确认),推理跑国产 AI 芯片 | 1/10 价格逼近 Opus 4.8;WB 内 0.06x,不重复画示意图 |
官方原话定位"为生产力而生"——770B 总参只激活 49B(6.4%),上下文突破 1M,8/28 发布即开源。腾讯内部 163 名专家、203 个工程任务盲测均分 2.99/4,略优于 GLM-5.3(2.92)与 Kimi K3(2.94)。
| 技术点 | 白话解释 | 解决什么问题 |
|---|---|---|
| 770B / 49B MoE | 相对 Hy3(295B/21B)参数翻 2.6 倍,激活占比反而降到 6.4% | 能力上探到大模型第一梯队,单次算力成本仍可控 |
| 1M 上下文 | 比 Hy3 的 256K 扩大 4 倍 | 整仓库代码、几十份报表一次喂进去 |
| 与 WorkBuddy / CodeBuddy Co-Design | 模型训练阶段就和 WB 产品深度协同,不是训完再适配 | 软件工程与办公场景的体感提升最明显(也就是你日常在 WB 里用的场景) |
| 递归自我改进闭环 | Hy4 亲自参与自己的训练方法、数据策略、评估体系、底层算子优化:提方案→跑实验→看结果→再迭代 | 首次把"模型自己改进自己"跑成闭环,研发提速 |
| 推理基建自优化 | 自主分析瓶颈、做算子融合与通信优化,端到端吞吐 +31.8%(不同上下文长度/并发度均稳定) | 同样的卡跑更多请求,是它能定低价的底气 |
| 数学实绩:Blaschke–Lebesgue 难题 | 三维几何体积下界从 0.380799 推进到 0.41104,距 Meissner 四面体猜想(0.41986)只剩约 2% 缺口 | 证明科研场景不只是跑分话术,有真实推进 [KNOWN 官方/媒体口径] |
| 已开源 | HuggingFace / GitHub / ModelScope / Gitcode 同步放出 | 可私有化部署(开源协议官方未明示 [UNVERIFIED]) |
295B 只激活 21B(7.1%)——单次算力利用率最高,所以便宜且稳。
| 技术点 | 白话解释 | 解决什么问题 |
|---|---|---|
| 192 专家 Top-8 | 每层 192 个专家,每个词元激活 8 个 | 粗粒度分工,训练/推理稳 |
| GQA 64Q/8KV | 多个查询头共享一组 KV 缓存 | KV cache 缩小,长上下文省显存 |
| 3.8B MTP | 附带小层一次预测多个 token | 解码加速 |
| 快慢思考融合 | reasoning_effort 同权重切换 | 简单直答、复杂深想 |
| Apache 2.0 | 权重完全开放 | 可私有化部署 |
2.8T / 104B 激活 / 896 专家选 16。杀手锏是 KDA 线性注意力。
| 技术点 | 白话解释 | 解决什么问题 |
|---|---|---|
| KDA(Kimi Delta Attention) | 固定大小循环状态替代增长的 KV cache | 1M 上下文解码不减速 |
| Attention Residuals | 每层学习加权残差,不简单相加 | 百层深网信息流动可控 |
| Stable LatentMoE | 潜空间专家计算 + Quantile Balancing 路由 | 解决专家冷热不均 |
| MoonViT-V2 | 原生视觉编码器 | 图文同源处理 |
| 扩展效率 2.5× | 同等算力训练产出是 K2 的 2.5 倍 | 万亿参数训练成本可控 |
| MoonEP / FlashKDA / AgentEnv | 弹性预部署 / KDA 算子 / Agent 训练环境 | 万卡 MoE + RL 工程底座 |
2.4T / 95B 激活 / 512 专家选 10 + 1 共享专家。闭源旗舰。
| 技术点 | 白话解释 | 解决什么问题 |
|---|---|---|
| 512 专家 10+1 | 10 个路由专家 + 1 个常驻共享专家 | 通用能力不被路由丢掉 |
| 92 层 / hidden 8192 / 词表 248,320 | 超深超宽、全球最大词表之一 | 中文/代码 token 效率高 |
| 原生 262K → 1M | 预训练即长上下文 | 长文档能力原生稳定 |
| 四模态原生 | 文本/图像/视频/文档预训练融合 | 跨模态因果链推理 |
| 双推理模式同权重 | 思考/非思考一套权重切换 | 按需花 token |
| Qwen 3.8-Flash(并入本节) | 轻量档:MoE 125B / 6B 激活、1M 上下文、文本+图片;缓存命中 Prefill 吞吐为 3.7-Plus 的 8.6 倍(08-27 上线)。另有 Flash-Next 开放权重预览版(08-26 权重 / 09-01 API,262K 原生、Qwen4 架构预览、N-gram 嵌入层跑系统内存),与生产版 Flash 非同一产物,选型时注意区分 | 价格仅 Max 的 1/15(¥0.8/¥2.7);架构路线同系,不重复画示意图 |
1.6T / 49B 激活。技术报告核心:把长上下文的算力账重新算了一遍。
| 技术点 | 白话解释 | 解决什么问题 |
|---|---|---|
| CSA + HCA 混合注意力 | 近处细看 + 远处粗看 | 1M 上下文仅 27% FLOPs / 10% KV cache |
| mHC 流形约束超连接 | 连接矩阵约束在双随机矩阵流形 | 超大模型训练稳定 |
| Muon 优化器 | 正交化二阶优化 | 收敛快、显存省 |
| FP4 + FP8 混合精度 | 不敏感层用 4bit | 训练成本大降 |
| 两阶段后训练 | 领域专家 GRPO → 同策略蒸馏 | 多领域能力都做深 |
| DeepSeek V4-Flash(并入本节) | 轻量档,架构与 V4 Pro 同系;284B/13B、原生 1M(09-04 核实);底座纯文本,Vision-Exp 变体 08-31 起支持图片且权重 MIT 开源;峰谷计价 | 便宜档供批量场景;参数未公布,不重复画示意图 [UNVERIFIED] |
OpenAI 未披露 GPT-5.6 详细架构 [UNVERIFIED]。公开信息:系列分 Sol(前沿/最贵)、Terra(日常)、Luna(高量/最便宜)三档。下图是 Codex CLI 作为 Agent 产品的工作循环——模型只是其中一环。
Anthropic 未公开 Claude 模型内部架构 [UNVERIFIED]。公开信息:Claude Pro 订阅包含 Claude Code,1M 上下文。下图是 Claude Code 作为 Agent 产品的工作循环。
~427B [第三方口径],权重已开源(MiniMax Community License)。官方定位 Coding & Agentic SOTA + 百万上下文 + 原生多模态三项兼备。
| 技术点 | 白话解释 | 解决什么问题 |
|---|---|---|
| MSA 稀疏注意力 | 稀疏化注意力,降低百万 token 的算力与显存开销 | 1M 上下文真正可 scale(保证 ≥512K 可用) |
| 原生多模态(Step 0 混合训练) | 预训练即混合 interleaved 文本/图片/视频 | 不像外挂拼接,能力更稳 |
| 三思考模式 | enabled(强推理)/ adaptive(自适应)/ disabled(低延迟) | 按任务选思考档,省 token |
| 开源(MiniMax Community License) | 权重已在 HF / GitHub 发布 | 可自部署,但 ~854GB,非单卡模型 |
06-24 火山引擎 FORCE 大会发布,Pro / Turbo 双版本,256K 上下文、文本+图片+视频入、闭源 API-only 无开源权重。Turbo 定价为 Pro 的一半。
| 技术点 | 白话解释 | 解决什么问题 |
|---|---|---|
| Pro / Turbo 双版本 | 同架构两档:Pro 旗舰深思考,Turbo 低成本低延迟 | 高频生产流量走 Turbo,难任务走 Pro |
| 256K 上下文 + 256K 最大输出 | 大窗口 + 长输出 | 大仓库切片、长多轮 Agent 会话 |
| 多模态(图/视频入) | OpenAI 兼容 image_url 块 | 截图/示意图可连同文本送入 |
| 闭源 API-only | 无开源权重,国内走火山方舟、国际走 BytePlus ModelArk | 不能私有化部署,对合规敏感场景慎用 |
| 模型 | 厂商 | 发布 | 参数 / 激活 | 上下文 | 多模态 | 开源 |
|---|---|---|---|---|---|---|
| GLM-5.3 | 智谱 | 08-14 | 743B | 1M | ❌ 纯文本 | ✅ 已开源(08-28,GLM-5.3 License,非 MIT) |
| GLM-5.3-Flash | 智谱 | 08-26 | 320B / 18B | 1M | ❌ 纯文本 [UNVERIFIED] | ✅ 已开源(MIT,即 OpenRouter 神秘模型 Ox Alpha) |
| 混元 Hy4 preview | 腾讯 | 08-28 | 770B / 49B | 1M | 未明确 [UNVERIFIED] | ✅ 已开源(协议未明示) |
| 混元 Hy3 | 腾讯 | 07-06 | 295B / 21B | 256K | ✅ 生图/3D/视频 | ✅ Apache 2.0 |
| Kimi K3 | 月之暗面 | 07-17 | 2.8T / 104B | 1M | ✅ 原生视觉 | ✅ 已开源 |
| Qwen 3.8-Max | 阿里 | 08-03 | 2.4T / 95B | 1M | ✅ 原生多模态 | ❌ 闭源 |
| Qwen 3.8-Flash | 阿里 | 08-27 | 125B / 6B | 1M | ✅ 文本+图片 | ❌ 闭源 |
| Qwen3.8-Flash-Next | 阿里 | 08-26 权重 / 09-01 API | 125B / 6B(另 +51B N-gram 嵌入 +4B MTP) | 262K 原生(YaRN 扩至 1M) | ✅ 文本+图片 | ✅ 开放权重(qwen-community-1.0,非 Apache;Qwen4 架构预览) |
| DeepSeek V4 Pro | 深度求索 | 08-13 | 1.6T / 49B | 1M | ❌ 纯文本 | ✅ 权重开放 |
| DeepSeek V4-Flash | 深度求索 | 未公布 | 284B / 13B | 1M(原生) | ❌ 纯文本(底座) | 未公布 [UNVERIFIED] |
| DeepSeek V4-Flash-Vision-Exp | 深度求索 | 08-21 API / 08-31 权重 | 305B(284B 底座 + 视觉塔 + Aligner) | 1M | ✅ 文本 + 图片 | ✅ 已开源(MIT,08-31,V4 家族首款多模态) |
| GPT-5.6 系 | OpenAI | 07-09 | 未公开 | — | ✅ 多模态 | ❌ 闭源 |
| Claude 4.x/5 | Anthropic | 持续更新 | 未公开 | 1M | ✅ 多模态 | ❌ 闭源 |
| Gemini 3.1 Pro | 未核实 | 未公开 | 2M | ✅ 原生多模态(文本/图像/视频/音频/PDF) | ❌ 闭源(Paid-only) | |
| Gemini 3.6 Flash | 未核实 | 未公开 | 未核实 | ✅ 多模态 [UNVERIFIED] | ❌ 闭源 | |
| Grok 4 | xAI | 未核实 | 未公开 | 256K | ✅ 多模态 + 工具调用 + 缓存 | ❌ 闭源 |
| Ling-3.0-Flash | 蚂蚁集团 | 09 月初 | 124B / 5.1B | 未核实 | 未明确 [UNVERIFIED] | ✅ 已开源(MIT) |
| MiniMax-M3 | MiniMax | 06-01 | 428B / 23B(官方口径) | 1M(托管保证 ≥512K) | ✅ 原生多模态(文本/图片/视频入) | ✅ 已开源(MiniMax Community License) |
| 豆包 Seed 2.1 Turbo | 字节跳动(火山引擎) | 06-24 | 未公开 | 256K | ✅ 文本+图片+视频入,文本出 | ❌ 闭源(无开源权重) |
| 基准 | GLM-5.3 | 混元 Hy3 | 混元 Hy4 preview | Kimi K3 | Qwen 3.8-Max | DeepSeek V4 Pro |
|---|---|---|---|---|---|---|
| 腾讯内部盲测(163 专家 / 203 工程任务,满分 4) | 2.92 | — | 2.99 ⭐ | 2.94 | — | — |
| Terminal-Bench | 28.3 (v3.0) | 71.7 (v2.1) | — | 88.3 (v2.1) | 86.1 (OSWorld) | 87.9(官方) |
| DeepSWE | 66.9 | 28.0 | — | 67.5 | — | 62.7 |
| SWE-Bench Pro | — | 57.9 | — | — | 67.7 | — |
| CyberGym(安全) | 84.5 ⭐ | — | — | — | — | 反超 Fable 5 |
| IFBench(指令遵循) | — | — | — | — | 82.8 ⭐ | 54.9 |
| HLE(前沿知识) | — | 53.2 | — | — | 43.6 ⚠️垫底 | — |
| GDPval-AA v2 | 1769 | — | — | 1682 | — | — |
GPT/Claude 不列入此表:与国产模型测试口径不一致,直接对比会误导(参见 morphllm 汇总:Claude Fable 5 SWE-bench Pro 80.3%、GPT-5.5 Verified 88.7%,但均为厂商自报口径)。国际参照见 L3 板块。
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| 混元 Hy4 preview | ¥6 | ¥18 | 缓存命中 ¥0.3;08-28 发布,WB/CodeBuddy 限时免费 2 周;旗舰能力·中档价(约为 Qwen 3.8-Max 的一半) |
| 混元 Hy3 | ¥1 | ¥4 | 最便宜 |
| DeepSeek V4 Pro | ~¥4.7 | ~¥14.2 | 低谷价,高峰翻倍;8/17 涨价 1.5–12 倍 |
| DeepSeek V4-Flash | ¥1.5(高峰 ¥3) | ¥4.5(高峰 ¥9) | 峰谷计价;纯文本;8/17 涨价后口径 [UNVERIFIED 之前核实] |
| Qwen 3.8-Max | ¥12 | ¥36 | 最贵(已订 Qwen 订阅套餐,按量价仅作上线后对照);09-05 10:00 自动升级为 qwen3.8-max-0902 快照版:计费不变,编码/智能体/视觉理解增强,可提前切模型名 qwen3.8-max-0902 测试 [KNOWN 阿里云官方短信 09-04] |
| Qwen 3.8-Flash | ¥0.8 | ¥2.7 | 缓存命中 ¥0.1;08-27 上线,价格仅 Max 的 1/15 [KNOWN 官方公告] |
| GLM-5.3 | 未公开 | API 08-19 已上线(原"即将上线"已过时);官方未公布单价 [UNVERIFIED] | |
| GLM-5.3-Flash | ~¥1.1 | ~¥3.6 | 标准价 $0.15/$0.50;限时折扣约再减半(输入低至 ~$0.07);WB 内订阅优先 0.06x |
| Kimi K3 | ¥20 | ¥100 | 缓存命中 ¥2;08-28 官方平台价 [KNOWN platform.moonshot.cn]——刷新"输出价全场最贵"记录,是 Qwen 3.8-Max(¥36)的 2.8 倍。原页面标注的"未公开 / 约 Fable 的 1/4"已作废 |
| MiniMax-M3 | ¥2.1(>512K:¥4.2) | ¥8.4(>512K:¥16.8) | 缓存命中 ¥0.42 / ¥0.84;阶梯计价(按单次请求输入长度所在档对整单计价);08 月较首发价降 50% [KNOWN 第三方 2026-08-27 抓取官方页] |
| 豆包 Seed 2.1 Turbo | ¥3 | ¥15 | 缓存命中 ¥0.6;旗舰版 Pro 为 ¥6/¥30,Turbo 正好一半 [KNOWN 火山引擎官方口径] |
| Gemini 3.1 Pro | $2(>200K 档:$4) | $12(>200K 档:$18) | 美元计价;2M 上下文;上下文缓存价直降 90%;闭源 Paid-only |
| Gemini 3.6 Flash | $1.50 | $7.50 | 美元计价;同系轻量档;Antigravity 托管 Agent 默认模型 |
| Grok 4 | $3 | $15 | 美元计价;256K;多模态 + 工具 + 缓存;Grok 4.1 Thinking 同价;GPQA 87.5%(官方口径) |
| Ling-3.0-Flash | 未核实 | 蚂蚁集团 09 月初新品;MIT 开源(124B/5.1B 激活);官方 API 价未核实 [UNVERIFIED] | |
GPT/Claude 的订阅价与 API 价单独列在「实际成本」板块,不与国产 API 混表。Gemini / Grok 行为美元原价(未折算人民币),按 ~7.1 汇率粗估人民币约为标价 × 7。MiniMax-M3 与豆包 Seed 2.1 Turbo 暂不列入上面基准表:截至 08-28 未找到与表中同口径的独立第三方跑分(MiniMax 官方主打 Coding/Agentic 与数学证明实绩,豆包官方只公布 Pro 版基准、Turbo 版无独立评测),填"—"会造成虚假对比,等有同口径数据再补。混元 3D 系列(HY-3D-3.1 等)不走 token 计价,属独立的 3D 内容生成 API,见下方「其他家族模型对比」板块。
| 模型 | 演进路径 | 核心定位 |
|---|---|---|
| GLM-5.3 | 基座没变(还是 5.2 的 743B),全靠后训练 Scaling 硬拉,编程体感提升 50%,网络安全能力"涌现" | 用工程换能力,性价比取向,网络安全审计是独门绝活 |
| GLM-5.3-Flash | GLM-5.3 的轻量/Flash 版(Z.ai 揭面此前匿名爆火的 Ox Alpha),沿用同一后训练体系做低成本输出 | 1/10 价格逼近 Opus 4.8,主打高并发性价比;WB 内订阅优先 0.06x,日常干活首选 |
| 混元 Hy4 preview | Hy3(295B/21B)→ Hy4(770B/49B),参数翻 2.6 倍、上下文 256K→1M,与 WB/CB 产品 Co-Design,并首次参与自身研发全链路(训练方法/数据策略/评估/算子) | "为生产力而生":软件工程·办公分析·游戏开发·科研四场景共建;内部盲测 2.99 小胜 GLM-5.3 / K3;开源 + ¥6/¥18 中档价 |
| 混元 Hy3 | 腾讯底层重建,半年完成基建→preview→正式版,295B 只激活 21B | 小体量打大体量,唯一文本+多模态都强的开源模型,最便宜 |
| Kimi K3 | K2.5→K3,2.8T 全球最大开源,KDA 线性注意力解决长文本解码速度 | 长文本 + 前端编程最强,但慢(耗时约 GPT-5.6 的 3 倍) |
| Qwen 3.8-Max | 2.4T MoE,PaperBench 反超 Sol、IFBench 指令遵循第一、OSWorld 计算机操作第一 | 多模态 + 指令遵循 + 计算机操作为王,但 HLE 垫底、最贵、闭源 |
| Qwen 3.8-Flash | 08-27 上线,125B/6B 激活、1M、文本+图片,同系轻量档 | 价格仅 Max 的 1/15(¥0.8/¥2.7),缓存命中 Prefill 吞吐为 3.7-Plus 的 8.6 倍——AI 客服类项目开发期主力 |
| DeepSeek V4 Pro | 1.6T 旗舰,8/13 正式版增强 Agent,官方 Terminal-Bench 87.9 逼近 Fable 5 | 纯文本、无视觉,性价比高但独立评测差距大、诚实度校准差 |
| DeepSeek V4-Flash | 同系轻量档,纯文本,峰谷计价 | 便宜档供批量场景,参数/架构未公布 [UNVERIFIED] |
| GPT-5.6 系 | GPT-5→5.5→5.6,7 月分三档(Sol/Terra/Luna),8 月 Sol 降价 20% 促销 [KNOWN 官方口径] | 编程 Agent 标杆,Codex 生态成熟;国际参照系 |
| Claude 4.x/5 | Opus 4.8→Opus 5(7/24 默认),Claude Code 迭代到 v2.1.x,周限额 +50% 延至 8/31 [KNOWN] | 终端编程体验标杆,1M 上下文;国际参照系 |
| MiniMax-M3 | M2.5→M2.7→M3(06-01),全新 MSA(MiniMax Sparse Attention)稀疏注意力撑起 1M 上下文,原生多模态(文本/图片/视频入),权重开源 | 官方口径"Coding & Agentic SOTA + 百万上下文 + 原生多模态三项兼备"的国产旗舰;WB 内 0.25x(文档处理/金融/数据可视化);数学证明搭配 MaxProof 超人类金牌线(官方口径) |
| 豆包 Seed 2.1 Turbo | 字节 Seed 2.1 系列 06-24 火山引擎 FORCE 大会发布,Pro / Turbo 双版本,Turbo 定价为 Pro 的一半 | 高频生产流量的低成本低延迟档;官方称"功能齐备、效果比肩 Pro"(厂商口径,需自测);闭源 API-only,国内走火山方舟、国际走 BytePlus ModelArk |
| 厂商 | 模型 | 类型 | 核心功能 | 备注 |
|---|---|---|---|---|
| 智谱 GLM | GLM-5v-Turbo | 视觉理解 | 识图、图文问答 | WB 内置 0.95x——本板块里你唯一可能用到的 |
| GLM 系列其他分支 | — | 未逐一核实 | 官方家族分支未核实,暂不列 [UNVERIFIED] | |
| 月之暗面 Kimi | Kimi-VL | 视觉语言 | 多模态推理、长上下文理解、视觉 Agent(16B MoE / 3B 激活) | 开源;K2.5 起主线模型已原生多模态 |
| Kimi-Audio | 音频基础模型 | 语音识别、音频理解、音频转文字聊天、语音到语音对话 | 开源 | |
| Kimi-Dev-72B | 代码专用 | 软件工程任务 | 开源,基于 Qwen2.5-72B | |
| MiniMax | 海螺 Hailuo 2.3 / 2.3 Fast | 视频生成 | 文生视频 / 图生视频 | Fast 为加速版 |
| MiniMax Speech 2.8 | 语音合成 | 文字转语音 | — | |
| MiniMax Music 2.6 | 音乐生成 | 文生音乐 | — | |
| 腾讯混元 | HY-3D 系列 | 3D 生成 | 文生 3D / 图生 3D / 白模,八视角重建 | 按次计费,不开源——详见下方专表 |
| 混元生图 / 生视频 | 图像 / 视频生成 | 主线 Hy3 已自带生图/3D/视频能力 | 混元相关能力正迁至腾讯云 TokenHub | |
| 阿里 Qwen | Qwen3-VL | 视觉语言 | 图片/视频理解、OCR、空间感知、GUI 视觉 Agent(上下文 256K) | 开源 + API(qwen3-vl-plus / flash) |
| Qwen3-Omni | 原生全模态 | 文本/图片/音频/视频入,文本 + 语音出(30B-A3B,119 种文字语言) | 实时流式响应,适合语音客服场景 | |
| Qwen3-ASR / Qwen3-TTS | 语音识别 / 语音合成 | 多语长音频转写(带时间戳)/ 流式情绪化语音合成 | 只做单项,不负责完整对话 | |
| Qwen-Image / Image-Edit | 图像生成 / 编辑 | 文生图、多图编辑 | 开源权重 + API | |
| Wan 2.5 | 视频 / 图像生成 | 原生带高保真音频的视频生成,时长 5→10 秒 | 阿里视频生成主线 |
| 模型 / 接口 | 作用 | 备注 |
|---|---|---|
| HY-3D-3.1 | 专业版主力:文生 3D、图生 3D、单几何生成(白模) | 2026-01-16 上线 [KNOWN 腾讯云产品动态];几何与纹理质量较 3.0 进一步提升,支持八视图多角度输入 |
| HY-3D-3.0 | 专业版上一代 | 2025-09-16 上线;内部 4 视角重建 |
| HY-3D-Express | 极速版:把生成时间压到 1 分 30 秒内 | 要快不要精时用它 |
| HY-3D-Texture | 给白模生成纹理贴图 | 输入单几何 + 参考图或文字描述 |
| HY-3D-Retopology | 智能拓扑:高模转低模,布线规整 | 采用 Polygon 1.5 模型 |
| HY-3D-Component | 自动识别模型结构、生成对应 3D 组件 | 2025-12-10 上线 |
| HY-3D-UV | 自动生成高质量 UV 切线 | 2025-12-10 上线 |
| HY-3D-Motion | 文生动作:按文本生成人物动作数据 | 输出带动画数据的 FBX |
| HY-3D-Rigging | 人物 / 动物模型绑骨蒙皮 | 输出带骨骼信息的 3D 模型 |
| HY-3D-Format | 3D 模型文件格式转换 | 支持 STL / USDZ / FBX 等输出 |
| 维度 | HY-3D-3.0 | HY-3D-3.1 |
|---|---|---|
| 内部重建视角 | 4 个 | 8 个(前/后/左/右/顶/底 + 两个 45° 位) |
| 你实际要上传 | 1 张图 | 仍然只要 1 张图(8 视角在模型内部合成) |
| 体感差异 | 背面/底部靠"猜",细薄结构易出瑕疵 | 背面和底部明显更忠实、四边形拓扑更干净、UV 岛排布更聪明、PBR 色彩更准 |
| 规格上限 [第三方口径] | — | 最高 4K PBR 纹理、150 万面数、水密几何体 |
| 开源情况 | 3.x 系列不开源,只能通过腾讯平台与合作 API 用;2.x 曾放出开放权重 [UNVERIFIED 第三方口径] | |
| 接入方式 | 腾讯云(混元相关能力正迁移至 TokenHub);网页体验入口 3d.hunyuan.tencent.com | |
| 模型 | 定位 | 上下文 | 架构公开度 |
|---|---|---|---|
| GPT-5.6 Sol | 前沿旗舰,Codex 默认 Power 档 | — | 未公开 |
| GPT-5.6 Terra | 日常档,CX 高频使用 | — | 未公开 |
| GPT-5.6 Luna | 高量低价档 | — | 未公开 |
| GPT-5.5 | 上一代旗舰,仍可用于代码审查 | — | 未公开 |
| Claude Opus 5 / 4.8 | CC 默认引擎(7/24 起 Opus 5) | 1M | 未公开 |
| Claude Sonnet 5 | CC 可选,均衡档 | 1M | 未公开 |
| Gemini 3.1 Pro | 2M 上下文旗舰,缓存价直降 90% | 2M | 未公开 |
| Gemini 3.6 Flash | 轻量档,Antigravity 托管 Agent 默认 | 未核实 | 未公开 |
| Grok 4 / 4.1 Thinking | xAI 旗舰 + 思考档(同价),GPQA 87.5%(官方口径) | 256K | 未公开 |
| 产品 | 厂商 | 形态 | 核心能力 | 用法 |
|---|---|---|---|---|
| Codex CLI(CX) | OpenAI | 终端 Agent + 云端任务 | 读库→改码→测试→提 PR;代码审查用 GPT-5.3-Codex,自动审查用 GPT-5.4 | 独立审查、复核、发布门 |
| Claude Code(CC) | Anthropic | 终端 Agent + VS Code/JetBrains | MCP、子 Agent、后台会话、CLAUDE.md 记忆、hooks、skills、自动压缩 | 主写代码 |
| WorkBuddy(WB) | 腾讯 | 桌面 AI 工作伙伴 | 多模型接入、skills、MCP 连接器、自动化、多层记忆 | 运营辅助、验收支持 |
产品层对照依据:morphllm 2026-08 汇总(Codex 默认 gpt-5.6-sol medium;Claude Code 默认 Opus 5,140k+ stars)+ OpenAI/Anthropic 官方文档。
| 厂商 | 模型 | 倍率 | 定位 |
|---|---|---|---|
| 腾讯 | 混元 Hy4 preview | 限时免费 2 周 | 08-28 新旗舰:770B/49B、1M 上下文、已开源;软件工程 / 办公分析 / 游戏 / 科研四场景共建;内部盲测 2.99 小胜 GLM-5.3(2.92)与 Kimi K3(2.94);API ¥6/¥18 |
| 混元 Hy3 | 限时免费 | 均衡型,办公场景任务成功率 90% | |
| HY3-3D-3.1 | 按次计费 | 3D 生成专用(文生 3D / 图生 3D / 白模),八视角重建,不走 token 计价——详见「其他家族模型对比」板块 | |
| 混元 | — | 通用型(旧版) | |
| 智谱 | GLM-5.2 | 0.79x | 工具调用、文档生成、执行类 |
| GLM-5.1 | 0.79x | 日常办公、代码开发 | |
| GLM-5v-Turbo | 0.95x | 识图、多模态 | |
| MiniMax | MiniMax-M3 | 0.25x | 文档处理、金融、数据可视化;06-01 发布,MSA 稀疏注意力 + 1M 上下文 + 原生多模态(文本/图片/视频入),权重已开源;API ¥2.1/¥8.4 |
| MiniMax-M2.7 | — | 文字创作、中文表达 | |
| 月之暗面 | Kimi-K3 | 1.62x | 长文档分析、深度推理 |
| Kimi-K2.7-Code | 0.57x | 代码、查 bug | |
| Kimi-K2.6 | — | 日常(旧版) | |
| 深度求索 | DeepSeek-V4-Pro | — | 推理、代码、深度 |
| DeepSeek-V4-Flash | — | 快省、批量 | |
| DeepSeek-V3.2 | — | 旧版 | |
| 自定义 | Qwen 3.8-Flash | 订阅档 | 轻量多模态·新(08-27 上线):MoE 125B/6B 激活、1M 上下文、文本+图片;日常多模态 + 轻 Agent + 长文档,价格仅 3.8-Max 的 1/15 |
| 自定义 | Qwen 3.8-Max | Qwen 订阅套餐 | 多模态、指令遵循、超长文档 |
| 服务 | 订阅 | 订阅月费 | API 价($/百万token,入/出) | 用量口径 |
|---|---|---|---|---|
| Codex(CX) | Plus | $20/月 | GPT-5.6 Terra $2/$12 · Sol $5/$30 · Luna $0.2/$1.2 [KNOWN 官方 2026-07-30 起] | 5 小时滚动窗口 + 周上限 |
| Claude(CC) | Pro | $20/月(年付$17/月) | Opus 5 $5/$25 · Sonnet 5 介绍价 $2/$10 [KNOWN 第三方汇总 2026-08] | 5 小时滚动窗口 + 周上限,Claude Code 含在内 |
| Qwen 3.8-Max | Qwen 订阅套餐(开发期) | ¥139/月(限时 7.7 折,原价 ¥180) | ¥12/¥36 | AI 客服项目开发期走订阅:10000 Credits/7天 + 3000/5小时,3-4 Agent 并发;上线实践后切按量付费(已开通备用);09-05 10:00 底层自动升 qwen3.8-max-0902 快照版(计费不变,编码/智能体/视觉增强)[KNOWN 阿里云短信 09-04] |
| 混元 Hy4 preview | WB 内置(限时免费 2 周) | 0(2 周内) | ¥6/¥18(缓存命中 ¥0.3) | 08-28 发布,WB/CodeBuddy 国内版+国际版首发;API 走腾讯云 TokenHub / OpenRouter,权重已开源可自部署 |
| 混元 Hy3 | WB 内置 | 0 | ¥1/¥4 | WB 内限时免费 |
| 中文名词 | 英文 | 含义 | 用途 | 举例 | 📖 书中释义与出处 |
|---|---|---|---|---|---|
| PR | Pull Request | 把代码改动提交到仓库的合并请求 | 团队协作 review 改动 | 在 GitHub 给 CC 改的 monitor.py 提 PR | — |
| Commit | Commit | 一次代码快照,附提交说明 | 记录改动历史 | git commit -m '重构 monitor.py' | — |
| Push | Push | 把本地提交上传到远程仓库 | 共享改动 | git push origin main | — |
| Merge | Merge | 把一个分支的改动合并到另一分支 | 集成代码 | 负责人确认后合并 CC 的 PR | — |
| Branch | Branch | 代码的并行副本 | 隔离不同功能开发 | feat/自建履约追踪平台-refactor | — |
| Code Review | Code Review | 人工/AI 检查代码改动 | 防 bug、统一规范 | CX 审查 CC 的代码 | — |
| Harness | Harness | 把模型包装成 Agent 的运行时框架:模型决定能力上限,Harness 决定落地方式(工具调用/上下文管理/沙箱/失败恢复) | Agent 与工具/会话/权限连接;DeepSeek Harness(dsh)因此走红:'一切皆插件'、Cordis 内核、可热插拔 | Codex CLI / Claude Code / dsh 都是 harness | “这些约束不是“写在Prompt里就完了”——必须在代码层面做硬限制。” —— 《做对判断:AI产品从0到1》5.5 Harness Engineering:让AI不失控的四道护栏(548人划线) |
| CLI | Command Line Interface | 命令行界面 | 脚本化、自动化操作 | Codex CLI / Claude Code | — |
| GUI | Graphical User Interface | 图形用户界面 | 可视化交互 | WorkBuddy 桌面端 | — |
| IDE | Integrated Development Environment | 集成开发环境 | 写代码、调试、运行一体 | Cursor / VS Code | — |
| MCP | Model Context Protocol | 模型连接外部工具的标准协议 | 让 AI 调用本地文件/数据库/浏览器 | WorkBuddy 用 MCP skill 连微信读书 | “MCP的本质——它是一个连接协议,前提是对方系统“能被连接”” —— 《做对判断:AI产品从0到1》第三章 搞懂AI技术栈——不为写代码,只为做判断(20人划线) |
| API | Application Programming Interface | 程序接口 | 系统间通信 | 调用 追踪平台 API 查物流 | “你至少要知道前端和后端的分工是什么、API是什么、状态管理是什么、日志怎么看。” —— 《做对判断:AI产品从0到1》9.2 Vibe Coding:产品经理必须掌握的四层能力(788人划线) |
| SDK | Software Development Kit | 软件开发工具包 | 封装 API 供调用 | 腾讯云 SDK | — |
| LLM | Large Language Model | 大语言模型 | 文本理解、生成、推理 | Qwen 3.8-Max | — |
| Prompt | Prompt / 提示词 | 给模型的输入指令 | 引导模型输出 | '把这段代码重构为 SQLite 版' | “踩坑提醒很多人把Prompt当“调参”——觉得改几个字试试、不行再改。” —— 《做对判断:AI产品从0到1》6.2 AI PRD八步框架(719人划线) “这些约束不是“写在Prompt里就完了”——必须在代码层面做硬限制。” —— 《做对判断:AI产品从0到1》5.5 Harness Engineering:让AI不失控的四道护栏(548人划线) |
| 上下文窗口 | Context Window | 模型一次能处理的 token 数量 | 决定能塞进多少资料 | K3 / Qwen / DeepSeek 均支持 1M | — |
| Token | Token | 模型处理文本的最小单位 | 计费和长度的基本单位 | 中文约 1.5 token/字 | — |
| Embedding | Embedding / 向量 | 把文本/图片转成向量 | 语义检索、RAG | 合同模板语义搜索 | “如果只做最基础的RAG——用户问题转向量,top-k召回最相似的片段——你会发现:它在“用户问法恰好和文档表达一致”的时候效果很好,但稍微换个问法就找不到。” —— 《做对判断:AI产品从0到1》4.3 检索策略:从“能查到”到“查得准”(794人划线) “理解技术方案的“能力边界”。你不需要知道向量数据库的索引算法怎么实现,但你必须知道它能解决什么问题、不能解决什么问题、在什么条件下会失效。” —— 《做对判断:AI产品从0到1》第三章 搞懂AI技术栈——不为写代码,只为做判断(36人划线) |
| RAG | Retrieval-Augmented Generation | 检索增强生成 | 让模型先查资料再回答 | 合同知识库问答 | “如果只做最基础的RAG——用户问题转向量,top-k召回最相似的片段——你会发现:它在“用户问法恰好和文档表达一致”的时候效果很好,但稍微换个问法就找不到。” —— 《做对判断:AI产品从0到1》4.3 检索策略:从“能查到”到“查得准”(794人划线) “团队在法务系统中每季度做一次“知识体检”——检查有多少法条已失效但仍在库中、有多少内容超过一年没被检索到(可能已经不再相关)、有多少新领域的法律问题频繁出现但知识库覆盖不足。” —— 《做对判断:AI产品从0到1》4.6 RAG是系统,不是项目(788人划线) |
| Fine-tuning | Fine-tuning | 在特定数据上继续训练模型 | 提升领域能力 | 暂不推荐,成本高风险大 | — |
| Streaming | Streaming | 模型逐字返回结果 | 提升交互体感 | WorkBuddy 对话流式输出 | — |
| Temperature | Temperature | 控制模型输出随机性 | 0 更确定,1 更发散 | 代码生成用 0.2,头脑风暴用 0.8 | — |
| 幻觉 | Hallucination | 模型编造不存在的信息 | 需要校验机制 | 合同条款引用必须回原文核对 | — |
| 多模态 | Multimodal(原生多模态) | 模型直接理解图像 / 视频 / 语音等多种输入。"原生"指架构内置这些能力,而非外挂视觉模块拼接 | 解析图纸、面单照片、单据扫描件 | Qwen 3.8-Max 原生多模态(强但贵);Hy3 免费(能力中等) | — |
| Agent | Agent | 能自主规划、调用工具、完成多步任务的 AI | 自动化复杂工作流 | Codex / Claude Code / WorkBuddy | “如果一次合同审查的AI成本是50块,但请一个初级法务人员做同样的事只要100块(而且他一天能做20份),那AI的成本优势就没有想象中那么大。” —— 《做对判断:AI产品从0到1》5.3 Agent评估体系:成、快、省、稳、安全(656人划线) “法务系统的成本控制策略是:14个Skill中,简单的(如NDA快筛、法条速查)用轻量模型处理,单次成本控制在几毛钱;” —— 《做对判断:AI产品从0到1》5.3 Agent评估体系:成、快、省、稳、安全(497人划线) |
| Workflow | Workflow / 工作流 | 按固定步骤执行的流程 | 稳定重复任务 | 每日 0 点微信消息归档 | “把“风险需要依据”写进文件里,大家都会接受。” —— 《AI 现场工程师》第6章 快,不等于糙:FDE的AI工程工作流(91人划线) “第三,状态约束,没有解决的警报不能随便获得完成证明,已经完成的任务要有结果,没有风险的状态不能既显示高的风险又显示低的风险。” —— 《AI 现场工程师》第6章 快,不等于糙:FDE的AI工程工作流(87人划线) |
| Tool Call | Tool Call / 工具调用 | 模型调用外部函数/工具 | 扩展模型能力 | 调用 Bash / Read / Write 工具 | — |
| System Prompt | System Prompt | 给模型的全局角色/规则指令 | 设定行为边界 | '你只能读取,不能删除生产文件' | — |
| 评测 | Evals / 评测体系 | 对 AI 系统做系统性测试与回归 | 防止改提示词/换模型后旧能力退化 | Agent 评测:成、快、省、稳、安全 | “指标:用户满意度评分、任务完成率(用户最终达到目标了吗)、修改率(用户对AI输出做了多少修改)、复用率(用户用了一次之后会不会再来用)。” —— 《做对判断:AI产品从0到1》7.3 评测体系的三层设计(591人划线) “PRD中评测系统需要回答四个问题:测试集怎么构建?” —— 《做对判断:AI产品从0到1》6.2 AI PRD八步框架(529人划线) |
| DeepSWE | Deep Software Engineering Benchmark | 软件工程基准:给模型一个真实 GitHub issue,看它能否自主定位问题并修出可通过测试的代码(SWE-bench 同源一脉,难度更高) | 横向比较模型的工程级修代码能力 | 选型表"代码审查"行依据:GLM-5.3 与 K3 得分 66.9 / 67.5 打平 | — |
| GDPval | GDP-Valued Agent Tasks(OpenAI 发布) | 经济价值基准:用真实白领任务(写报告 / 做表格 / 数据分析等)测 Agent,分数 ≈ 该任务由人完成的市场价值(美元)——衡量"交付商业价值"而非刷题 | 判断模型产出是否有真实商业价值 | 选型表"复杂架构设计"行依据:GLM-5.3 的 GDPval-AA 得 1769,开源模型最高 | — |
| 递归自我改进 | Recursive Self-Improvement | 模型参与自身的训练方法、数据策略、评估体系与底层算子优化:提方案 → 跑实验 → 看结果 → 再迭代,形成闭环 | 判断"模型自己改进自己"是真闭环还是营销话术 | Hy4 preview 首次跑通全链路,并自主做算子融合/通信优化使端到端吞吐 +31.8% | — |
| 八视角重建 | 8-View Reconstruction | 3D 生成内部管线:从你上传的 1 张图出发,内部合成前/后/左/右/顶/底加两个 45 度位共 8 个视角,再据此构建网格——上一代只有 4 个视角 | 判断图生 3D 的背面/底部是否可信 | HY-3D-3.1 靠它把背面和底部的还原保真度明显拉高于 3.0 | — |
| 水密几何体 | Watertight Mesh | 3D 网格完全封闭、无破面无开口,内部是实心的 | 3D 打印的硬性前置条件(非水密模型切片软件会报错或打废) | HY-3D-3.1 输出水密几何体,可直接进切片软件 [第三方口径] | — |
| 兜底策略 | Fallback / 兜底 | AI 输出不可靠时的降级路径 | 控制风险边界 | 路由置信度低→不猜,反问用户 | “法务系统的兜底设计:路由置信度低于阈值→不猜,反问用户“您想做的是合同审查还是法条查询?”” —— 《做对判断:AI产品从0到1》6.2 AI PRD八步框架(792人划线) “兜底策略通常包含三层:拦截层——在AI输出到达用户之前,检查是否触发了任何红线。” —— 《做对判断:AI产品从0到1》6.2 AI PRD八步框架(777人划线) |
命中 10/32 个词条。未命中不代表书中没讲——只代表该书热门划线池(读者共同划出的 Top 句子)里没有直接出现该词。页码说明:微信读书为流式电子书,无固定页码,故以章节 + 划线内容定位。
| 环节 | 要点 | 对应场景 |
|---|---|---|
| 需求澄清 | 用 PRD 把业务规则翻译成可验证标准;三层交付:PRD→原型→可运行结果 | 合同生成工具的文档类型开关设计 |
| Prompt 设计 | 系统/角色/约束/示例四层;别把 Prompt 当"调参" | 价卡规则引擎的指令设计 |
| 评测体系 | PM 自己建 bad case 集 + 回归测试;评测要回答:测试集怎么构建、指标是什么 | 自建系统重构后的验收 |
| 上线交付 | 兜底三层:拦截层 / 反问层 / 知识体检 | 合同条款引用回原文核对 |
| 数据回流 | 用户反馈→迭代 Prompt / 知识库;季度"知识体检"清失效内容 | 退货入库收费规则迭代 |
| 环节 | 要点 |
|---|---|
| 现场调研 | 客户说什么不重要,看他怎么干活;追溯"不良项目"背后的历史数据和改进方案 |
| 最小可信 Demo | 3 天做出可点亮的证据;高危项显著显示,已解决/无风险显式表达 |
| 数据口径 | 数据不是燃料,是现场事实;风险标记区分来源:原始记录/业务规则/模型推理/人工添加 |
| 接口与权限 | 权限结构要反映实际组织架构,否则业务决定只能由技术管理员执行 |
| 结果推进 | 结果不一定是财务指标:可运行主路径、可复用口径、稳定错误处理、责任交接都算 |
| 原则 | 内容 |
|---|---|
| 角色分工 | 只读任务给 GLM-5.3,落盘任务给 CC/WB,受控动作(Git/VPS/发布)只交给 WB 内的代码执行型模型 |
| 审批门 | 只读核查→设计→实现→测试→暂存→推送→部署→生产写入,各门独立审批 |
| 证据分级 | [KNOWN]/[INFERRED]/[UNVERIFIED] 全程标注;测试通过≠生产事实 |
| Agent 接力风险 | 多 session 接力时错误层层叠加,必须建立污染源定位、复盘、责任交接机制(CX→CC 接力三层叠错教训) |
| 决策 | 结论 | 依据 |
|---|---|---|
| 千问订阅套餐 vs 按量 | 开发期 Qwen 订阅套餐(¥139/月),主力模型用 3.8-Flash(价格为 Max 的 1/15);上线实践后切按量付费;09-05 10:00 底层自动升 qwen3.8-max-0902 快照版(计费不变) | 开发期高频迭代,包月额度摊薄成本;Flash 让同等 Credits 跑 15 倍对话量;生产期按真实调用量计费更可控 |
| Codex 档位 | Plus $20/月够用;重度再上 Pro | Sol 任务 5–40 额度/任务 |
| 腾讯云轻量 | 2核4G5M ¥188/年(你已选定) | 多年定价对比完成 |
| WB 内模型选择 | 干活默认 GLM-5.3-Flash(订阅优先 0.06x,工具调用/执行强,近免费);08-28 至 09-11 优先试 混元 Hy4 preview(限时免费 2 周,770B/49B 新旗舰);纯闲聊 Hy3 免费;代码执行 K2.7-Code(0.57x);顶配推理/安全审计仍 GLM-5.3(0.79x) | 08-28 截图实测:GLM-5.3-Flash 0.06x 在 WB 可选,比 GLM-5.3 省 13 倍;同日 Hy4 preview 发布并在 WB 首发、免费 2 周——免费期内把日常活挪过去实测,2 周后按体感决定是否付费(API ¥6/¥18) |
| 课程 | 时长 | 学什么 |
|---|---|---|
| Claude 101(起步首选①) | 13 课 · 2.5 小时 | Claude 全貌入门;免费版套餐即可跟练实操 |
| AI Capabilities and Limitations(起步首选②) | 13 课 · 3.5 小时 | 模型能力与边界:什么任务该交给 AI、哪里会翻车——"判断什么时候该用 AI"的地基 |
| AI Fluency: Framework & Foundations | 14 课 · 4 小时 | 4D 框架:委派 Delegation(是否/何时交给 AI)/ 描述 Description(把目标说清楚)/ 判别 Discernment(评估产出可用性)/ 尽责 Diligence(为使用结果负责)——Anthropic 员工 onboarding 同款教材,CC BY-NC-SA 开源 |
| Claude Code 101 | 12 课 · 1 小时 | CLI Agent 入门(CC 用户直接相关;实操需 Pro/Max 套餐或 API key) |
| Introduction to Model Context Protocol | 10 课 · 1 小时 | MCP 工具连接协议入门(对应本页术语表 MCP 条目;需 Python 基础) |
官方五条设计原则:增强人的能动性(而非只教按钮在哪)/ 思维方式比功能长久("今天的 AI 是你用过最差的 AI")/ 决策发生在打开聊天窗之前 / 主动练习而非被动看视频 / 把 AI 当学习伙伴。开发者线另有 Building with the Claude API(67 课 · 9 小时)、MCP 进阶、subagents、agent skills 等课程。
| 核心观点 | 要点 | 出处 |
|---|---|---|
| AI 产品经理三层交付 | 不能只交付 PRD 或原型;第三层是把算法/数据/业务/测试拉齐的"可运行结果" | 《做对判断》1.3 |
| 兜底三层设计 | 拦截层(输出前红线检查)→ 反问层(置信度低不猜)→ 知识体检(季度清失效) | 《做对判断》6.2 |
| RAG 是系统不是项目 | 上线只是开始;季度体检:失效法条、一年未被检索内容、高频新问题 | 《做对判断》4.6 |
| Vibe Coding 四层能力 | PM 至少懂前后端分工、API、状态管理、日志——否则无法判断 Agent 产出 | 《做对判断》9.2 |
| FDE 推进结果 | 把现场问题变成可运行主路径、可复用口径、稳定错误处理方式 | 《AI 现场工程师》前言 |
| 愿望压缩成问题 | 只保留一条价值链;追溯不良项目的历史数据和工程方案 | 《AI 现场工程师》第4章 |
| 三天最小可信 Demo | 点检项必须和预测不良、工程任务、管理视图对齐 | 《AI 现场工程师》第5章 |
| 数据是现场事实 | 风险标记区分四种来源:原始记录/业务规则/模型推理/人工添加 | 《AI 现场工程师》第7章 |
| 权限反映组织 | 业务决定只能由技术管理员做时,权限结构就错了 | 《AI 现场工程师》第10章 |
| 核心观点 | 要点 | 出处 |
|---|---|---|
| 无聊能力 | 能无聊→能深度思考→知道自己要什么→能判断 AI 给的够不够好 | 《什么人越来越贵》前言/第八章 |
| 认知 Jevons 悖论 | 思考成本降低后,会思考的人思考更多,不会的人更少,差距加速分离 | 《什么人越来越贵》第二章 |
| 先想五分钟再问 AI | 那五分钟的"想"才是判断力生长的土壤 | 《什么人越来越贵》第二章 |
| 编排者 vs 老虎机玩家 | 只做质检不生产,人被降格;价值在判断框架和内容深度 | 《什么人越来越贵》第四章 |
| Agent 的"能用错觉" | Agent 表演"正在做事",人对正在做事的东西天然更信任,容易高估 | 《Agent 测试指南》第1章 |
| 先定义交付再定义测试 | 看五件事:结果交付、轨迹可信、环境动作正确、卡住能恢复/求助、该交权时交还给人 | 《Agent 测试指南》第3章 |
| 离线评测及格线 | 单次跑分只说明今天还行;改提示词/换模型/调检索后旧能力会悄悄退化 | 《Agent 测试指南》第4章 |
| Agent 失手模式 | 多 Agent 接力时错误层层叠加,需要污染源定位与复盘机制(切身体会) | 《Agent 测试指南》第8章 |
张羽其余 4 本(《AI 时代产品经理的第一课》《管理者如何带团队用 AI》《有效沟通》《AI 时代的教育》)书架在册,暂无热门划线数据。若思 2 本(《AI项目实录》《职场十年》)同样暂无。
| 任务 | 推荐 | 理由 |
|---|---|---|
| 日常数据汇总、文档、定时任务 | 混元 Hy3 | 内置免费,幻觉率 5.4%,办公场景成功率 90% |
| WB 日常干活 / 长文档办公(08-28 起 2 周窗口) | 混元 Hy4 preview | 770B/49B + 1M 上下文(Hy3 仅 256K),与 WB 产品 Co-Design、办公场景重点优化,内部盲测 2.99 略胜 GLM-5.3(2.92)与 Kimi K3(2.94);限时免费 2 周,零成本。⚠️ 发布首日、独立评测缺失——自建履约追踪系统 重构、AI 客服等生产关键任务先不要切,免费期内拿它和 GLM-5.3-Flash 跑同一批任务做对照,2 周后按实测结果定 |
| 3D 内容生成(仓库布局可视化、产品 3D 展示) | HY3-3D-3.1 | 文生 3D / 图生 3D / 白模,八视角重建,规格高于 3.0。但属非主业需求、按次计费、不在 订阅额度内、3.x 不开源——[PROPOSED] 当前无明确需求时先不投入,等客户要看仓库三维方案再启用 |
| 代码审查(CC 产出) | GLM-5.3 / Kimi K3 | DeepSWE 66.9/67.5 打平,GLM 安全审计强,K3 长代码库强 |
| 超长文档/整代码库一次性喂 | Kimi K3 | 1M 上下文 + KDA 解码加速,长文本主场 |
| 多模态(解析图纸/单据照片) | Qwen 3.8-Flash / Qwen 3.8-Max | 日常解析用 3.8-Flash(¥0.8/¥2.7,缓存命中 ¥0.1);极致效果或顶配兜底才上 Max(¥12/¥36);省钱兜底 Hy3 免费 |
| 轻量 Agent / 长文档 RAG / 知识库问答 | Qwen 3.8-Flash | 1M 上下文 + 90% 缓存命中时 Prefill 吞吐是 3.7-Plus 的 8.6 倍;长输入场景缓存 ¥0.10/百万 token 成本碾压 |
| AI 客服项目(开发期主力) | Qwen 3.8-Flash | 同 3.8 系列能力、价格仅 Max 的 1/15——Qwen 订阅套餐 ¥139/月内对话量约 15 倍于用 Max;思考强度选"中"(简单任务低/关、多步任务高) |
| 复杂架构设计(自建履约追踪系统 重构) | GLM-5.3 / 混元 Hy4 preview(对照) | GDPval-AA 1769 全开源最高;Hy4 preview 在腾讯内部 203 个工程任务盲测里略胜 GLM-5.3(2.99 vs 2.92)——免费期内可让两者出同一份重构方案做交叉验证,再定主用哪个 |
| 工作 | 最合适执行者 / 模型 | 职责边界 |
|---|---|---|
| 需求澄清、方案草案 | GLM-5.3 | 只读,不允许落盘或改文件 |
| 实际代码实现 | CC(Claude Code) 主写 | 主要代码执行者,按授权范围实现 |
| WB 需要代为执行代码 | Kimi-K2.7-Code | WB 内置代码模型,0.57x 低倍率,代码执行型 |
| 独立代码审查、回归与发布门 | CX(Codex) + CC 复核 | CX 审查验证,CC 二次复核,双角色把关 |
| Git / VPS / 模板发布等受控动作 | Kimi-K2.7-Code | 不用 HY3 或 GLM-5.3——受控动作只交代码执行型模型 |