最近一段时间,AI 大模型的更新速度快得有点离谱。昨天还在讨论谁是第一梯队,过几天榜单、价格和使用方式就又变了。
我也没忍住,陆续花钱体验了几款目前比较受关注的高端模型:Claude Fable 5、GPT-5.6 SOL、Kimi K3、GLM-5.3,以及 DeepSeek V4-Pro。测试内容主要是我平时真的会做的事情——重构网站、设计前端、补功能、排查 Bug、阅读项目和完成长流程任务,而不是专门挑几道模型擅长的题。
先把结论放在前面:如果只看我个人使用时的综合惊喜,Fable 5 最强;如果要长期干活、兼顾能力与成本,我更愿意选 GPT-5.6 SOL;国产模型里,Kimi K3 的前端巧思最亮眼,GLM-5.3 则是最像一个可靠工程搭档的那个。
这不是实验室评测,也不是“谁跑分高谁就赢”的排行榜。它是一篇个人付费实测:结论会受到任务类型、Harness、提示词、运行环境和我自己的审美影响。
先说我的主观排序
| 位置 | 模型 | 我最认可的地方 | 最明显的遗憾 |
|---|---|---|---|
| 1 | Fable 5 | 综合完成度最高,前端设计经常超出提示词 | 真的贵,长任务更贵 |
| 2 | GPT-5.6 SOL | 工程能力成熟,Plus 订阅下性价比很高 | 有时过于谨慎,测试和返工偏多 |
| 3 | Kimi K3 | 国产模型里前端细节和动效最有巧思 | 整体审美的克制感还差一点 |
| 4 | GLM-5.3 | 能啃复杂项目,Z Code 搭配起来很完整 | 主力可用的 Pro 档需要 538 元/月 |
| 5 | DeepSeek V4-Pro-0813 | 跑分不弱,合适环境下仍有竞争力 | 没有固定订阅,长期 API 成本不易预估 |
Fable 5:像拿到一支神笔,但每一笔都不便宜
单看模型层次,Fable 5 是这几款里最让我惊喜的。
尤其是网页前端。很多模型能把页面“做出来”,Fable 5 更像是在参与设计:它不只执行我写在提示词里的要求,还会注意到信息层级、空状态、交互反馈和一些我根本没想到的小功能。有几次我只给了一个比较粗的方向,它交付的结果却已经像经过一轮产品讨论。
那种感觉确实很像神笔马良——你画一个轮廓,它不仅把东西变出来,还顺手补上了光影、结构和用途。惊喜不是来自夸张的渐变和满屏动画,而是它知道什么地方应该再多想一步。
问题也非常直接:贵。Fable 5 当前官方 API 标价为每百万输入 Token 10 美元、输出 Token 50 美元。短任务还能接受,一旦进入“读完整项目—修改—测试—返工”的循环,账单会迅速让人恢复理智。
我的评价:预算不敏感、追求最高完成度时,它是我最愿意先试的模型;但作为每天长时间使用的主力,成本压力很难忽略。
GPT-5.6 SOL:目前最有性价比的高端工程模型
GPT-5.6 SOL 没有每次都像 Fable 5 那样让人“哇”一下,但它给我的感觉更老练:知道一个真正要上线的程序,不能只在截图里好看。
它特别喜欢防御性编程。做完功能以后会继续检查边界条件、兼容性和异常路径,跑测试,发现问题,再回去修改。有时候甚至谨慎得让我觉得它像一个追求极致的完美主义者——明明已经能用了,它还想再确认一遍。
这种习惯偶尔会让流程显得慢,甚至出现“测试—返工—再测试”的循环;但在真正的项目里,我宁愿它多检查一次,也不想拿到一份只在理想条件下成立的代码。
它的前端审美也不错。没有 Fable 5 那么惊艳,却有一种前沿、克制而且熟练的感觉。更重要的是,它通常能理解我真正想解决的问题,而不是只完成提示词表面的动作。
我认为它性价比高,关键并不是 API 单价,而是 ChatGPT Plus 每月 20 美元的订阅。对我这种会持续开发、反复修改项目的人来说,固定月费比每次调用都盯着 Token 更容易控制成本。Plus 里可以使用 GPT-5.6 SOL 的中、高推理档位,虽然不包含最贵的 SOL Pro,但已经足以覆盖我绝大多数真实需求。
我的评价:如果只能选一个模型作为日常开发主力,我大概率会选 GPT-5.6 SOL。它是这几款里最像“真的能替我把事情做完”的 AI。
Kimi K3:国产前端能力里最精致的一次惊喜
我曾经用相同的提示词,让 Kimi K3、GPT-5.6 SOL、DeepSeek V4-Pro 和豆包 2.1 Pro 分别完成同一版网页。那一轮里,Kimi K3 给出的结果是我觉得最精致的。
它很会处理动画和小细节:元素进入的节奏、按钮反馈、卡片之间的关系,以及一些不抢眼但能让页面更顺滑的过渡,都处理得很认真。单论整体美感和克制,我仍然觉得 GPT-5.6 SOL 更成熟;但论设计巧思和“这里居然也想到了”,Kimi K3 反而更胜一筹。
这也是它最特别的地方。它不是单纯把国产模型的代码能力做得更高,而是在前端表达上形成了一点自己的风格。官方资料显示 Kimi K3 支持 1M 上下文,并把编码、计算机操作和长时间 Agent 任务作为重点能力。当前 API 标价为每百万缓存未命中输入 Token 3 美元、输出 Token 15 美元。
我的评价:如果主要做网页、活动页、产品原型,或者希望模型多给一点交互灵感,Kimi K3 很值得试。它并不总是最稳的,但很容易给人留下记忆点。
GLM-5.3 + Z Code:国产模型里真正能解决复杂需求的那一个
一开始要不要测试 GLM-5.3,我其实纠结了很久。Z Code 的 Coding Plan Lite 档是每月 118 元,但以我这种持续读项目、改代码和跑长任务的用量来看,真正能稳定当主力使用的基本只有 每月 538 元的 Pro 档。这个价格对个人用户来说绝不是一个可以闭眼下单的数字,尤其是在同时订阅了其他产品以后,很容易让人望而生畏。
最后我还是买了。原因很简单:作为当时最受关注的国产开放权重模型之一,我想知道它到底只是榜单好看,还是能真正接手一个复杂项目。
实际体验证明,它名副其实。搭配官方的 Z Code 使用时,它给我的感觉只比 GPT-5.6 SOL 差一筹:能读项目、理解目标、修改代码,也能在任务卡住以后继续往下找办法。更难得的是,在一次项目重构里,它根据现有业务主动设计了一个我没有要求的新功能,而且这个功能不是为了炫技,是真的有用。
这种“理解项目后再多走一步”的表现,在我测试过的国产模型里仍然很少见。它的前端美感距离 Fable 5 和 GPT-5.6 SOL 还有差距,但已经完全够用;而在复杂任务的可执行性上,它是我目前最认可的国产选择之一。
我的评价:如果希望使用国产模型完成较复杂的真实开发,而不是只写几个函数或回答问题,GLM-5.3 值得认真考虑。Z Code 不是可有可无的外壳,它确实放大了模型的工程能力。
DeepSeek V4-Pro-0813:期待很高,实际体验却有些拧巴
我对它原本有很高的期待。此前 V4-Flash 给过我不少惊喜,而 V4-Pro 发布时的官方成绩也很强,很多项目已经接近甚至超过同期高端模型。我本来以为它会顺理成章地成为新的常用主力。
但至少在我一开始的实际使用里,正式版给我的完成度甚至不如 V4-Flash 稳定。换回 DeepSeek Harness、Linux 环境,并把提示词写得更克制以后,它的能力才更容易发挥出来。也就是说,它并非没有能力,而是比我预期中更“挑使用方式”。
网上有人把这种现象归因于训练过拟合,但我没有找到足够可靠的官方证据,因此不能把这个猜测当成事实。对我来说,能够确认的只有体验本身:一个 Pro 模型如果需要用户摸索很多前置条件,才能接近它在跑分里展示的状态,那就是产品层面的摩擦。
价格也是这次体验里绕不开的一部分。DeepSeek 目前没有推出类似 ChatGPT Plus 或 Z Code Coding Plan 的固定月费订阅,V4-Pro 主要还是按 API 用量计费。峰时每百万缓存未命中输入 Token 为 1.32 美元,输出 Token 为 3.96 美元,低峰时减半。单看 API 单价,它依然低于国外高端模型;但当 GPT-5.6 SOL 可以通过每月 20 美元的 Plus 订阅长期使用时,DeepSeek 每一次调用都在累计费用,重度使用下来反而会显得昂贵,而且月底到底花多少并不容易提前判断。
值得一提的是,V4-Flash 接入 WorkBuddy 依然很好用。日常办公、中等复杂度的信息整理和流程任务,它仍然是一个成本更低、速度更轻快的选择。
我的评价:V4-Pro 的能力没有跑分看起来那么令人失望,问题是它没有像我期待的那样开箱即用。高预期、涨价和环境敏感叠在一起,让这次体验显得格外拧巴。
跑分怎么看:同一张表里,也不是每一项都由同一个模型领先
先强调一句:官方跑分能够帮助我们判断能力边界,却不能代替自己的任务。不同厂商会使用不同 Harness、推理预算和测试配置,哪怕评测名称相同,结果也可能发生变化。
下面第一张表整理自 Z.ai 的 GLM-5.3 官方发布图,四款模型在同一张官方图中进行比较,方便观察它们各自擅长什么。除 GDPval-AA v2 为 Elo 分外,其余均为百分制,均是越高越好。
| 评测 | GLM-5.3 | Kimi K3 | Fable 5 | GPT-5.6 SOL |
|---|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 17.4 | 33.7 | 34.6 |
| DeepSWE | 66.9 | 67.5 | 69.7 | 72.7 |
| Agents' Last Exam | 28.5 | 27.6 | 23.8 | 28.6 |
| AutomationBench | 48.2 | 46.7 | 46.2 | 45.8 |
| HLE with Tools | 62.5 | 59.8 | 63.9 | 64.5 |
| GDPval-AA v2(Elo) | 1769 | 1682 | 1743 | 1730 |
这张表很有意思:GPT-5.6 SOL 在终端、软件工程和工具推理上领先;GLM-5.3 则在 AutomationBench 和 GDPval-AA v2 上拿到最高分。也就是说,“综合最强”不等于“所有场景都最强”。
DeepSeek V4-Pro 使用的是另一套官方发布表,评测版本与上表并不完全相同,因此不应该把数字直接拼在一起排名。下面保留它与同表模型的成绩:
| 评测 | V4-Pro-0813 | V4-Flash-0731 | Kimi K3 | Fable 5 |
|---|---|---|---|---|
| HLE(无工具 / 有工具) | 42.7 / 60.0 | 37.8 / 51.5 | 43.5 / 56.0 | 53.3 / 63.0 |
| Terminal Bench 2.1 | 87.9 | 82.7 | 88.3 | 88.0 |
| DeepSWE | 62.7 | 54.4 | 67.5 | 70.0 |
| Toolathlon-Verified | 74.1 | 70.3 | 76.5 | 77.9 |
| AutomationBench(Public) | 31.8 | 25.1 | 30.8 | 29.1 |
| DSBench-Hard | 67.2 | 59.6 | 63.0 | 68.3 |
DeepSeek V4-Pro 并不是“跑分不行”。相反,它比预览版和 Flash 有明显提升,在 AutomationBench 上还拿到了同表最高分。我的不满主要来自跑分与开箱体验之间的落差,而不是否认它的能力。
我实际使用时的成本对比
只比较 API 单价,会掩盖这几款产品最大的区别:有些模型可以通过固定月费订阅使用,有些只能按 Token 计费。下面列的是我实际选择这些产品时面对的主要成本入口。订阅套餐与 API 并不是同一种计费方式,不能直接换算,但固定支出是否可预测,本身就是个人用户判断性价比的重要部分。
| 模型 | 主要使用入口 | 价格或计费方式 | 我的实际感受 |
|---|---|---|---|
| Claude Fable 5 | API | 输入 $10 / 输出 $50 | 能力最惊艳,长任务成本也最高 |
| GPT-5.6 SOL | ChatGPT Plus | $20 / 月 | 固定月费,是我认为它性价比最高的关键 |
| Kimi K3 | API | 输入 $3 / 输出 $15 | 价格与能力比较平衡 |
| GLM-5.3 | Z Code Coding Plan Pro | ¥538 / 月 | Lite 为 ¥118,但我的工作量基本需要 Pro 档 |
| DeepSeek V4-Pro | API | 峰时输入 $1.32 / 输出 $3.96 | 没有月费订阅,重度使用时成本缺少上限感 |
这张表也解释了为什么我会把 GPT-5.6 SOL 评价为“最有性价比的高端模型”。这里的性价比不是它的 API 最便宜,而是 20 美元的 Plus 订阅把成本固定了下来。反过来,DeepSeek 的单次 API 价格虽然更低,却没有订阅套餐兜底;如果每天大量使用,持续累加的调用费用会带来更强的成本压力。
如果让我给不同需求的人推荐
- 预算充足,追求前端效果和惊喜:Fable 5。
- 需要一个长期开发主力:GPT-5.6 SOL。
- 偏爱国产模型,主要做网页和产品原型:Kimi K3。
- 想用国产模型处理复杂工程项目:GLM-5.3 + Z Code。
- 在意成本,需求以中等办公和日常 Agent 为主:DeepSeek V4-Flash + WorkBuddy。
- 愿意调 Harness 和环境,想挖掘 DeepSeek 上限:再考虑 V4-Pro-0813。
最后:真正的跑分,是它能不能把事情做完
体验完这一轮以后,我越来越不愿意用一个总分判断模型。
Fable 5 会让我惊叹,GPT-5.6 SOL 会让我放心,Kimi K3 会在细节上给我灵感,GLM-5.3 会让我看到国产工程模型真正可用的样子,DeepSeek V4-Pro 则提醒我:一张漂亮的官方表格,与用户拿到手以后能否稳定发挥,中间还隔着 Harness、产品设计和大量使用细节。
对于普通用户来说,最重要的不是模型在某一项评测里多了两分,而是你把一个真实任务交给它以后,它能不能理解、执行、检查,并最终给你一个可以继续使用的结果。
如果非要把这轮体验压缩成一句话,那就是:最强的模型不一定最适合长期使用,最便宜的模型也不一定最省钱;真正有价值的 AI,是那个能让你少返工、还能偶尔给你惊喜的搭档。
数据来源:OpenAI:GPT-5.6、ChatGPT 订阅价格、Anthropic:Claude Fable 5、Kimi K3 官方发布、Z.ai:GLM-5.3、Z Code Coding Plan、DeepSeek V4-Pro 官方发布。模型更新很快,价格与成绩均以官方最新页面为准。