我花重金体验了 5 款顶级 AI:谁最惊艳,谁最能干活?

最近一段时间,AI 大模型的更新速度快得有点离谱。昨天还在讨论谁是第一梯队,过几天榜单、价格和使用方式就又变了。

我也没忍住,陆续花钱体验了几款目前比较受关注的高端模型:Claude Fable 5、GPT-5.6 SOL、Kimi K3、GLM-5.3,以及 DeepSeek V4-Pro。测试内容主要是我平时真的会做的事情——重构网站、设计前端、补功能、排查 Bug、阅读项目和完成长流程任务,而不是专门挑几道模型擅长的题。

先把结论放在前面:如果只看我个人使用时的综合惊喜,Fable 5 最强;如果要长期干活、兼顾能力与成本,我更愿意选 GPT-5.6 SOL;国产模型里,Kimi K3 的前端巧思最亮眼,GLM-5.3 则是最像一个可靠工程搭档的那个。

这不是实验室评测,也不是“谁跑分高谁就赢”的排行榜。它是一篇个人付费实测:结论会受到任务类型、Harness、提示词、运行环境和我自己的审美影响。

先说我的主观排序

位置 模型 我最认可的地方 最明显的遗憾
1 Fable 5 综合完成度最高,前端设计经常超出提示词 真的贵,长任务更贵
2 GPT-5.6 SOL 工程能力成熟,Plus 订阅下性价比很高 有时过于谨慎,测试和返工偏多
3 Kimi K3 国产模型里前端细节和动效最有巧思 整体审美的克制感还差一点
4 GLM-5.3 能啃复杂项目,Z Code 搭配起来很完整 主力可用的 Pro 档需要 538 元/月
5 DeepSeek V4-Pro-0813 跑分不弱,合适环境下仍有竞争力 没有固定订阅,长期 API 成本不易预估

Fable 5:像拿到一支神笔,但每一笔都不便宜

单看模型层次,Fable 5 是这几款里最让我惊喜的。

尤其是网页前端。很多模型能把页面“做出来”,Fable 5 更像是在参与设计:它不只执行我写在提示词里的要求,还会注意到信息层级、空状态、交互反馈和一些我根本没想到的小功能。有几次我只给了一个比较粗的方向,它交付的结果却已经像经过一轮产品讨论。

那种感觉确实很像神笔马良——你画一个轮廓,它不仅把东西变出来,还顺手补上了光影、结构和用途。惊喜不是来自夸张的渐变和满屏动画,而是它知道什么地方应该再多想一步。

问题也非常直接:贵。Fable 5 当前官方 API 标价为每百万输入 Token 10 美元、输出 Token 50 美元。短任务还能接受,一旦进入“读完整项目—修改—测试—返工”的循环,账单会迅速让人恢复理智。

我的评价:预算不敏感、追求最高完成度时,它是我最愿意先试的模型;但作为每天长时间使用的主力,成本压力很难忽略。

GPT-5.6 SOL:目前最有性价比的高端工程模型

GPT-5.6 SOL 没有每次都像 Fable 5 那样让人“哇”一下,但它给我的感觉更老练:知道一个真正要上线的程序,不能只在截图里好看。

它特别喜欢防御性编程。做完功能以后会继续检查边界条件、兼容性和异常路径,跑测试,发现问题,再回去修改。有时候甚至谨慎得让我觉得它像一个追求极致的完美主义者——明明已经能用了,它还想再确认一遍。

这种习惯偶尔会让流程显得慢,甚至出现“测试—返工—再测试”的循环;但在真正的项目里,我宁愿它多检查一次,也不想拿到一份只在理想条件下成立的代码。

它的前端审美也不错。没有 Fable 5 那么惊艳,却有一种前沿、克制而且熟练的感觉。更重要的是,它通常能理解我真正想解决的问题,而不是只完成提示词表面的动作。

我认为它性价比高,关键并不是 API 单价,而是 ChatGPT Plus 每月 20 美元的订阅。对我这种会持续开发、反复修改项目的人来说,固定月费比每次调用都盯着 Token 更容易控制成本。Plus 里可以使用 GPT-5.6 SOL 的中、高推理档位,虽然不包含最贵的 SOL Pro,但已经足以覆盖我绝大多数真实需求。

我的评价:如果只能选一个模型作为日常开发主力,我大概率会选 GPT-5.6 SOL。它是这几款里最像“真的能替我把事情做完”的 AI。

Kimi K3:国产前端能力里最精致的一次惊喜

我曾经用相同的提示词,让 Kimi K3、GPT-5.6 SOL、DeepSeek V4-Pro 和豆包 2.1 Pro 分别完成同一版网页。那一轮里,Kimi K3 给出的结果是我觉得最精致的。

它很会处理动画和小细节:元素进入的节奏、按钮反馈、卡片之间的关系,以及一些不抢眼但能让页面更顺滑的过渡,都处理得很认真。单论整体美感和克制,我仍然觉得 GPT-5.6 SOL 更成熟;但论设计巧思和“这里居然也想到了”,Kimi K3 反而更胜一筹。

这也是它最特别的地方。它不是单纯把国产模型的代码能力做得更高,而是在前端表达上形成了一点自己的风格。官方资料显示 Kimi K3 支持 1M 上下文,并把编码、计算机操作和长时间 Agent 任务作为重点能力。当前 API 标价为每百万缓存未命中输入 Token 3 美元、输出 Token 15 美元。

我的评价:如果主要做网页、活动页、产品原型,或者希望模型多给一点交互灵感,Kimi K3 很值得试。它并不总是最稳的,但很容易给人留下记忆点。

GLM-5.3 + Z Code:国产模型里真正能解决复杂需求的那一个

一开始要不要测试 GLM-5.3,我其实纠结了很久。Z Code 的 Coding Plan Lite 档是每月 118 元,但以我这种持续读项目、改代码和跑长任务的用量来看,真正能稳定当主力使用的基本只有 每月 538 元的 Pro 档。这个价格对个人用户来说绝不是一个可以闭眼下单的数字,尤其是在同时订阅了其他产品以后,很容易让人望而生畏。

最后我还是买了。原因很简单:作为当时最受关注的国产开放权重模型之一,我想知道它到底只是榜单好看,还是能真正接手一个复杂项目。

实际体验证明,它名副其实。搭配官方的 Z Code 使用时,它给我的感觉只比 GPT-5.6 SOL 差一筹:能读项目、理解目标、修改代码,也能在任务卡住以后继续往下找办法。更难得的是,在一次项目重构里,它根据现有业务主动设计了一个我没有要求的新功能,而且这个功能不是为了炫技,是真的有用。

这种“理解项目后再多走一步”的表现,在我测试过的国产模型里仍然很少见。它的前端美感距离 Fable 5 和 GPT-5.6 SOL 还有差距,但已经完全够用;而在复杂任务的可执行性上,它是我目前最认可的国产选择之一。

我的评价:如果希望使用国产模型完成较复杂的真实开发,而不是只写几个函数或回答问题,GLM-5.3 值得认真考虑。Z Code 不是可有可无的外壳,它确实放大了模型的工程能力。

DeepSeek V4-Pro-0813:期待很高,实际体验却有些拧巴

我对它原本有很高的期待。此前 V4-Flash 给过我不少惊喜,而 V4-Pro 发布时的官方成绩也很强,很多项目已经接近甚至超过同期高端模型。我本来以为它会顺理成章地成为新的常用主力。

但至少在我一开始的实际使用里,正式版给我的完成度甚至不如 V4-Flash 稳定。换回 DeepSeek Harness、Linux 环境,并把提示词写得更克制以后,它的能力才更容易发挥出来。也就是说,它并非没有能力,而是比我预期中更“挑使用方式”。

网上有人把这种现象归因于训练过拟合,但我没有找到足够可靠的官方证据,因此不能把这个猜测当成事实。对我来说,能够确认的只有体验本身:一个 Pro 模型如果需要用户摸索很多前置条件,才能接近它在跑分里展示的状态,那就是产品层面的摩擦。

价格也是这次体验里绕不开的一部分。DeepSeek 目前没有推出类似 ChatGPT Plus 或 Z Code Coding Plan 的固定月费订阅,V4-Pro 主要还是按 API 用量计费。峰时每百万缓存未命中输入 Token 为 1.32 美元,输出 Token 为 3.96 美元,低峰时减半。单看 API 单价,它依然低于国外高端模型;但当 GPT-5.6 SOL 可以通过每月 20 美元的 Plus 订阅长期使用时,DeepSeek 每一次调用都在累计费用,重度使用下来反而会显得昂贵,而且月底到底花多少并不容易提前判断。

值得一提的是,V4-Flash 接入 WorkBuddy 依然很好用。日常办公、中等复杂度的信息整理和流程任务,它仍然是一个成本更低、速度更轻快的选择。

我的评价:V4-Pro 的能力没有跑分看起来那么令人失望,问题是它没有像我期待的那样开箱即用。高预期、涨价和环境敏感叠在一起,让这次体验显得格外拧巴。

跑分怎么看:同一张表里,也不是每一项都由同一个模型领先

先强调一句:官方跑分能够帮助我们判断能力边界,却不能代替自己的任务。不同厂商会使用不同 Harness、推理预算和测试配置,哪怕评测名称相同,结果也可能发生变化。

下面第一张表整理自 Z.ai 的 GLM-5.3 官方发布图,四款模型在同一张官方图中进行比较,方便观察它们各自擅长什么。除 GDPval-AA v2 为 Elo 分外,其余均为百分制,均是越高越好。

评测 GLM-5.3 Kimi K3 Fable 5 GPT-5.6 SOL
Terminal Bench 3.0 28.3 17.4 33.7 34.6
DeepSWE 66.9 67.5 69.7 72.7
Agents' Last Exam 28.5 27.6 23.8 28.6
AutomationBench 48.2 46.7 46.2 45.8
HLE with Tools 62.5 59.8 63.9 64.5
GDPval-AA v2(Elo) 1769 1682 1743 1730

这张表很有意思:GPT-5.6 SOL 在终端、软件工程和工具推理上领先;GLM-5.3 则在 AutomationBench 和 GDPval-AA v2 上拿到最高分。也就是说,“综合最强”不等于“所有场景都最强”。

DeepSeek V4-Pro 使用的是另一套官方发布表,评测版本与上表并不完全相同,因此不应该把数字直接拼在一起排名。下面保留它与同表模型的成绩:

评测 V4-Pro-0813 V4-Flash-0731 Kimi K3 Fable 5
HLE(无工具 / 有工具) 42.7 / 60.0 37.8 / 51.5 43.5 / 56.0 53.3 / 63.0
Terminal Bench 2.1 87.9 82.7 88.3 88.0
DeepSWE 62.7 54.4 67.5 70.0
Toolathlon-Verified 74.1 70.3 76.5 77.9
AutomationBench(Public) 31.8 25.1 30.8 29.1
DSBench-Hard 67.2 59.6 63.0 68.3

DeepSeek V4-Pro 并不是“跑分不行”。相反,它比预览版和 Flash 有明显提升,在 AutomationBench 上还拿到了同表最高分。我的不满主要来自跑分与开箱体验之间的落差,而不是否认它的能力。

我实际使用时的成本对比

只比较 API 单价,会掩盖这几款产品最大的区别:有些模型可以通过固定月费订阅使用,有些只能按 Token 计费。下面列的是我实际选择这些产品时面对的主要成本入口。订阅套餐与 API 并不是同一种计费方式,不能直接换算,但固定支出是否可预测,本身就是个人用户判断性价比的重要部分。

模型 主要使用入口 价格或计费方式 我的实际感受
Claude Fable 5 API 输入 $10 / 输出 $50 能力最惊艳,长任务成本也最高
GPT-5.6 SOL ChatGPT Plus $20 / 月 固定月费,是我认为它性价比最高的关键
Kimi K3 API 输入 $3 / 输出 $15 价格与能力比较平衡
GLM-5.3 Z Code Coding Plan Pro ¥538 / 月 Lite 为 ¥118,但我的工作量基本需要 Pro 档
DeepSeek V4-Pro API 峰时输入 $1.32 / 输出 $3.96 没有月费订阅,重度使用时成本缺少上限感

这张表也解释了为什么我会把 GPT-5.6 SOL 评价为“最有性价比的高端模型”。这里的性价比不是它的 API 最便宜,而是 20 美元的 Plus 订阅把成本固定了下来。反过来,DeepSeek 的单次 API 价格虽然更低,却没有订阅套餐兜底;如果每天大量使用,持续累加的调用费用会带来更强的成本压力。

如果让我给不同需求的人推荐

  • 预算充足,追求前端效果和惊喜:Fable 5。
  • 需要一个长期开发主力:GPT-5.6 SOL。
  • 偏爱国产模型,主要做网页和产品原型:Kimi K3。
  • 想用国产模型处理复杂工程项目:GLM-5.3 + Z Code。
  • 在意成本,需求以中等办公和日常 Agent 为主:DeepSeek V4-Flash + WorkBuddy。
  • 愿意调 Harness 和环境,想挖掘 DeepSeek 上限:再考虑 V4-Pro-0813。

最后:真正的跑分,是它能不能把事情做完

体验完这一轮以后,我越来越不愿意用一个总分判断模型。

Fable 5 会让我惊叹,GPT-5.6 SOL 会让我放心,Kimi K3 会在细节上给我灵感,GLM-5.3 会让我看到国产工程模型真正可用的样子,DeepSeek V4-Pro 则提醒我:一张漂亮的官方表格,与用户拿到手以后能否稳定发挥,中间还隔着 Harness、产品设计和大量使用细节。

对于普通用户来说,最重要的不是模型在某一项评测里多了两分,而是你把一个真实任务交给它以后,它能不能理解、执行、检查,并最终给你一个可以继续使用的结果。

如果非要把这轮体验压缩成一句话,那就是:最强的模型不一定最适合长期使用,最便宜的模型也不一定最省钱;真正有价值的 AI,是那个能让你少返工、还能偶尔给你惊喜的搭档。


数据来源:OpenAI:GPT-5.6ChatGPT 订阅价格Anthropic:Claude Fable 5Kimi K3 官方发布Z.ai:GLM-5.3Z Code Coding PlanDeepSeek V4-Pro 官方发布。模型更新很快,价格与成绩均以官方最新页面为准。

上一篇 我把像素莓重新设计了一遍:从“模板感”到 macOS 式技术工作台
夏木

夏木

AI 辅助开发者 | 开源项目作者

"代码是最好的注释,注释是最差的代码。"

—— 夏木