← 返回免费内容库
实战笔记复盘案例免费公开

7 分钟 · 更新于 2026-09-23

Grok4.7评测排名前列,我为何还是退订了它?

做一人公司写代码交付产品,工具顺不顺手,实际用起来最清楚。对于最近这几款模型,我的实际使用判断很直接:Grok 4.7 智能程度很差,写代码总是只照顾眼前的局部,没有全局意识,用着太累,我已经退订。

孟健 · 主理人实战记录 · 可在文末讨论
Grok4.7评测排名前列,我为何还是退订了它?免费公开
章节索引5 个标题 · 点击展开

大家好,我是孟健。

我已经把 Grok 的订阅取消了。

做一人公司写代码交付产品,工具顺不顺手,实际用起来最清楚。对于最近这几款模型,我的实际使用判断很直接:Grok 4.7 智能程度很差,写代码总是只照顾眼前的局部,没有全局意识,用着太累,我已经退订。

Claude Opus 5.5 很不错,最大的感觉是说人话,是个扎实的大进步。而在 GPT 阵营里,新出的 GPT 6 Sol 在我目前的体感里不及 Astra;至于小模型 Luna,性价比极高,适合拿来打杂。

面对这么多新名字,我们真正要搞明白的不是厂商吹了什么,而是干活时到底该怎么挑、怎么省钱。


01 审视 Grok 4.7:榜单跑分上涨,日常协作依然卡手#

第三方评测榜单上,Grok 4.7 的分数确实涨了不少。

涨分确实是客观事实。在 Artificial Analysis 9 月 21 日的评测文章里,Grok 4.7 在 xhigh 推理档位、配合专属的 Grok Build 框架下,Coding Agent Index 测到了 56 分,比上一代的 47 分高出一截。这个基准测了挺多项任务,进步本身我不否认。

Artificial Analysis 评测 Grok 4.7 的文章与成绩分布

Artificial Analysis 评测 Grok 4.7

但基准跑分归跑分,自己动手搭业务归自己动手搭业务。一人公司写项目,最耗精力的地方往往不是单个函数怎么写,而是上下游之间的呼应。

打个比方,假设你要给某个模块补一个鉴权判断或者改一下返回字段。如果一个模型缺乏全局意识,它可能会把当前这个函数改得挑不出毛病,语法完美、单测也绿了。可一旦放到整体流程里,上层调用的接口根本没传它新加的参数,或者下游页面展示的状态和这个改动打架了,甚至把原有的兼容逻辑给悄悄抹掉了。这种“局部看全对、放进系统全错”的情况只要多来几次,你就得把整条调用链路人工在脑子里重跑一遍。

写代码不仅是生成一段代码片段,更要保证系统整体行为的一致。如果一个模型总是需要我在后面反复提防它会不会顾头不顾尾,省下来的敲键盘时间全贴补给排查联调了。我的退订决定来自当前的实际干活体感,榜单测得再好,干活不顺手我就不想继续付费。


02 评估 Claude Opus 5.5:说人话能显著减轻改代码负担#

直接看 Claude Opus 5.5,它的实际表现令人印象深刻。

最直观的体验就是:它终于说人话了。Anthropic 官方在 9 月 22 日发布 Opus 5.5 时,特意提到他们在沟通层面做了优化,让表达更自然,并有意识地把核心结论往前放。而在我自己的日常使用中,这种“说人话”的感受特别强烈。

以前有些模型回复起来,先给你铺垫三五段正确的废话,扯一堆术语和设计模式,真正的方案和关键修改藏在最底下。你得先耐着性子做完“阅读理解”,才能搞懂它到底想怎么改。Opus 5.5 则常常是开门见山,先把做法和潜在的顾虑直接抛给你,让人一眼看清思路。对于一个人负责整个产品线的人来说,这种沟通方式极大地减轻了脑力负担,你能立刻判断这个方向靠不靠谱,该盯防哪些边界条件。

CodeRabbit 针对 Opus 5.5 的 bug 检出效果评估

CodeRabbit 针对 Opus 5.5 评估

当然,表达变清楚了,绝不等于代码就自带免死金牌,改出来的逻辑照样得仔细过目。

CodeRabbit 在他们的 Standard 审查流水线里测过 Opus 5.5 面对 80 种开源 bug 的表现:Opus 5.5 抓到了 baseline 漏掉的 11 个 bug,但同时也漏掉了 baseline 抓到的 9 个 bug。这说明模型能力的提升更像是换了一批擅长捕捉和容易遗漏的盲区,而不是无懈可击。说人话能让我们看懂方案、审阅更轻松,但该写的自动化检查和人工审查,一步都不能省。


03 对比 GPT 家族:当前体感 Sol 不及 Astra,Luna 成本优势显著#

在 OpenAI 这边,Astra、Sol 和 Luna 三款模型划出了非常清晰的价格档位。

按官方公布的标准 API 定价,每百万 token 的输入和输出费用分别是:Astra 是 10 美元和 50 美元,Sol 是 2 美元和 10 美元,而轻量级的 Luna 只要 0.10 美元和 0.50 美元。Luna 比 Astra 便宜了足足两个数量级。

面对这几款,我建议大家不要看着新名字就直接当作主力。Sol 虽然主打 Agent 编程场景,但在我目前的编码实操体感里不及 Astra。真遇到多层依赖、长上下文或者需要推敲架构的难活,我还是更信任 Astra。

Artificial Analysis 针对各主力模型的智能与成本分布图

Artificial Analysis 智能与成本分布

不过 Luna 给了我很大的惊喜。在 Artificial Analysis 的评测里,在 max 推理档位配合 Codex harness 下,Luna 的 Coding Agent Index 从上一代的 43 微微变动到 41,但单项任务的测试成本直接降了约 60%。

但在我个人的选型原则里,便宜并不意味着可以默认拿它去交付复杂长任务。大活有大活的复杂度,低价模型适合拿来做一眼看得到边界的小任务,比如写个特定格式的数据转换、补几条清晰的单测,这时 Luna 的超低成本优势就完全显现出来了。


04 实测 0.29 美元隔离样本:验证单次任务下的成本与表现#

为了在受控环境下看看手感,我从自己 ShipSolo 的会员业务里抽了一个独立测试样例。

这个样例一共包含三个文件,整体和线上生产环境彻底隔离,但三个文件之间通过导入相互协作:其中一个 policy 文件是真实业务规则的只读副本,另外两个文件是人工简化的适配器,保留了旧逻辑,分别对应 API 详情、API 列表和页面卡片这三个入口。

题目要求它们统一会员权限规则:一旦新会员记录存在,就绝对不能回退到旧套餐去放行,哪怕新记录是个空数组;遇到过期或撤销的会员状态,必须干净利落地拒绝;详情和列表 API 绝对不能泄漏被锁定的正文;前端页面卡片的状态展示与跳转行为,必须跟后端接口保持一致。

验收标准很死:本地写了 20 组账户测试场景,外加 TypeScript strict 模式编译检查。代码由 API 单次返回后在本地独立跑脚本,不走复杂 Agent 循环。

实测汇总结果我直接贴在下面:

验收结果与扣费汇总截图

本轮验收与扣费汇总

这一轮里,GPT 阵营的三款各拿了一个完整候选样本,结果全都在 20 组测试场景里拿了 20/20,并通过了 tsc strict 检查。但在扣费上差距极度夸张:Luna 这一趟花了约 0.0015 美元,Sol 花了约 0.0184 美元,Astra 则是 0.0907 美元。

另外两款在这轮里没有拿到有效代码:Grok 4.7 客户端等待 300 秒超时没返回代码,渠道计费约 0.1795 美元;Opus 5.5 连续遇到了两次 429 报错,扣费是 0。这五个入口总共打了 6 次 API 请求,账单总共花了 0.290018 美元,也就是 0.29 美元左右。需要说明的是,这些调用层面的异常并不用于判定模型本身的能力高低,而且我对 Grok 4.7 的退订决定也发生在这项小实验之前。

老老实实讲,单靠这一道题,确实没有在具体成绩上测出我日常体感里的“Sol 不及 Astra”。不过在这个小样例上,Luna 确实顺利通过了测试,这支持了在明确的小任务上优先尝试低成本方案的策略,但它并不代表只要收拢边界就能保证便宜小模型通杀所有复杂场景。


05 规划日常取舍:按任务分工匹配成本,避免盲目追新#

模型迭代再快,掏钱买单的还是我们自己。面对这些模型,我的使用逻辑已经收拢得很清晰:

复杂的大活,交给 Astra 或 Claude Opus 5.5。尤其是多模块串联、需要想明白再动手的任务,Opus 5.5 讲人话、要点在前,审阅起来顺畅;Astra 功底扎实,大局拿捏稳当。把钱花在它们身上,是我愿意为减少沟通和复核负担付费的选择,当然最终代码依然不能免去人工验收。

边界收拢的琐碎小活,先让便宜的 Luna 上。小修小补、转换字段、局部脚本,用 Luna 跑一趟成本几乎可以忽略不计,它能做完你就赚了;做不好再升档也不迟。

至于新出的 Sol,我目前用下来的体感依然不及 Astra,不会拿它当全能主力;而 Grok 4.7 因为总让人在全局联动上提心吊胆,退订了也就退订了,省下费用和精力。

选工具不需要跟风追逐每个新发布的代号。把任务切清楚,难活找明白人,杂活找低成本帮手,这套组合跑下来,交付效率才是真正掌握在自己手里的。

觉得有用,转给正在做出海的朋友

Related

相关阅读

Reader discussion

围绕这篇内容继续讨论

提具体问题、补充实践证据,也可以回复其他读者。

0 条讨论
登录后参与讨论

免费注册即可评论;阅读本身不需要登录。

登录 / 注册

正在读取讨论…