GPT-5.5 全面碾压 Claude?我用三个真实任务测了一遍

GPT-5.5 全面碾压 Claude?我用三个真实任务测了一遍

OpenAI 刚刚发布了 GPT-5.5,在自家的榜单中全面地碾压了 Claude。

GPT-5.5 发布页(First Impressions)

我用三个真实的任务测了一遍,发现里面有一个游戏任务是完全用不了的。

在真实测试之前,我们先快速过一下发布的细节。

发布细节

GPT-5.5 是 OpenAI 最新发布的模型,上一代是 GPT-5.4。这一次的模型有几个变化:

  • 上下文:升到了 400k,比之前更多。
  • Terminal Bench 2.0:GPT-5.5 拿到 82% 的准确率,GPT-5.4 是 75%,Claude Opus 4.7 只有 69%。

Terminal-Bench 2.0 综合榜单

  • 价格:GPT-5.5 比 GPT-5.4 翻了一倍,甚至比 Opus 4.7 还要高

价格柱状图

不过根据官方说法,GPT-5.5 的输出 Token 变得更少了,所以整体看下来价格可能反而更低

具体到底如何,单看官方榜单是不够的。我直接进入测试。

测试方法

三个任务都用同一个提示词、同一份素材文件夹,两边都开启完全访问权限(避免被反复问权限),思考深度都调到最高,保持公平。

  • 实验一:个人品牌网页
  • 实验二:可玩的 2D RPG 小游戏
  • 实验三:开放式创意任务(提示词由 Claude Code 自己生成,我自己也不知道结果)

实验一:个人品牌网页

提示词相同,素材也相同——文件夹里有 3 张 GPT 生成的图片,加上我的个人档案(一些 AI 帮我写的内容)。

耗时:Codex 13 分钟,Claude Code 13 分钟。速度差不多

效果对比(上:Claude Code / 下:GPT-5.5):

个人品牌网页对比长图

放慢速度让你自己判断。不过我自己的看法是——Claude Code 完胜。它做的是黑底摄影杂志风:左大字标题 + 右人物大图,整体”作品感”和”个人品牌”质感都更到位。GPT-5.5 那一版虽然内容也写完了,但交差都不太够——视觉表达偏普通,做不出”独立作者品牌”的味道。

这一轮:Claude Code。

实验二:可玩的 2D RPG 小游戏《夜行山海》

任务是构建一个可玩的 2D 中式志怪风小游戏,玩家是夜行书生,要躲妖怪、收符纸、点灯笼。提示词相同,仅修改了文件命名,避免覆盖上一轮的产物。

耗时:Claude Code 4 分 05 秒,Codex 9 分 14 秒

先看美术风格——开始页两边都做得不错,国风感都有。

开始页左右对比图

但进游戏才是关键——

游戏内画面左右对比图

Claude Code:上下左右移动正常、能捡符纸、有阻碍物(小树挡的格子有点多)、被怪撞到会僵直——不确定是 bug 还是有意设计的。整体可玩

Codex:打开就发现不对劲——人物大得离谱,“我这么大吗?“画面只能看到自己周围一小块,开局就掉血直接死。完全玩不了。

GPT-5.5 用 9 分 14 秒做出一个完全玩不了的游戏,Claude Code 用 4 分 05 秒做出一个能玩的。这一局没什么好比的。

这一轮:Claude Code。

实验三:开放式创意任务

这一题特别——前两个有明确答案(做个网站、做个游戏),但这一题我没指定要做什么,只让它表达一个观点。

而且这个提示词是让 Claude Code 帮我写的,所以我自己也不知道两边会做出什么。具体提示词就不贴了,大致是:把”先想清楚要做什么再选模型”这个观点,做成一个可交互的网页作品。

耗时:Claude Code 8 分 08 秒,GPT-5.5 10 分 06 秒

Claude Code 这版

Claude Code 模型焦虑实验室·过场页

“这是一场 90 秒的实验,你将选择如何度过它,并亲眼看见选择的代价。“过场页挺好看的——上面是”看看最新最强的模型”和”先想想我要做什么”两个选择。

如果你点”看看最新最强的模型”,会进入一个红色 ticker 不断滚动”刚发布 / 比上一代提升 12% / LMArena 榜单第一”的焦虑画面,让你亲眼看到追逐新模型时的状态

Claude Code·"焦虑流"画面

如果你点”先想想我要做什么”,会问你三个问题:你想完成什么 / 什么是必须满足的 / 什么算交付。基于你的回答,最后告诉你:先看任务再选模型,不要问哪个模型更强,先问你要完成什么任务

Claude Code 模型焦虑实验室·三问交互页

事实上这就是我视频脚本里的一个内容——它根据我的脚本大纲,反推出了这第三个提示词的核心观点。

GPT-5.5 这版

GPT-5.5 模型焦虑实验室

第一眼会觉得有点复杂——“任务是什么 / 模型焦虑 / 任务清晰度”。点开玩了一下就明白了:如果你不停追逐更好的模型,“模型焦虑”数值会上升,旁边的任务界面会越乱;如果你的任务定义越明确,界面就越清晰。它还把任务拆成”任务定义 / 任务简报 / 按任务选择模型”几个结构化字段,让你能直观看到自己的”任务区域”在不同选择下的工作树状态。

这一轮怎么看?

  • Claude Code 设计页面更好看,过场更有质感
  • GPT-5.5 内核我更喜欢,因为它把”焦虑”和”清晰度”做成了可量化、可操作的工作树

这一轮我投 GPT-5.5。 不是因为视觉,而是因为内核——它把抽象观点真正落到了一个能拆解、能选择、能交付的结构化界面上。

我的真实结论

三个任务测完,Claude Code 在大多数任务上稳定性更强——尤其是实验二游戏那一轮,差距太大。但 GPT-5.5 也不是没有优势:第三轮的开放式创意任务,它把抽象观点转成了一个结构化、可量化的工作树,内核反而比 Claude Code 更深

不过我想说的不止是这个对比结果。

现在各家模型公司发布的速度越来越快——今天 OpenAI 发,明天 Anthropic 发,每一家都想跟对方一较高下。但对于普通用户而言,现在的模型能力已经能够很好地优化我们的工作流程了

我更多考虑的是:

  • 我什么样的任务,交给什么样的模型?
  • 我的工作流里,有哪些地方能让 AI 帮我去优化?

而不是一味追求分数更高、更贵的模型。

当你知道模型的边界,知道你的工作流应该如何优化,那你使用任何模型,其实都能达到很好的效果。

任何模型的发布,我们都不需要感到焦虑。


OK,这就是本期的内容。如果对你有帮助,欢迎评论转发。