自 Opus 4.5 以来真正的六边形战士,Opus 5.5。
这是网友们对 Opus 5.5 的评价,不仅价格对比 Opus 5 更低,核心能力表现也更加出色。
而六天后发布的 Sonnet 5.5 则是进一步把这种性价比拉到了极致,更快的速度,更高的跑分以及更低的成本。

社交媒体上也涌现了一大波利用 Opus 5.5 或者 Sonnet 5.5 实现的有趣案例,有人花一晚上就做了个 MV,有人用网页就能实现各类大型物理和世界游戏,还有人生成了沙丘里的 3D 沙虫。
层出不穷的创意,比起模型发布技术博客里那些复杂的成绩单,也更能让大家停下滑动的手指,认真看看这个模型生成的作品。
网友们也开始意识到 Opus 5.5 的能力就像 benchmark 里面显示的一样,无论拿它来做什么,在各方面都表现很好。

我们找了十多个题材和玩法各不相同的案例,用这些在 X 上浏览量都几十上百万的「好看」作品,带大家看看网友们眼下都在怎么用大语言模型,以及这些酷炫的案例和一个真正的用得称手的模型之间,又有什么差距。
而且,很快 Claude 的 5.5 或将迎来新一轮刷屏,Fable 5.5 已经曝光了。

用通用模型做视频生成
一个五分钟的 MV,X 博主 @anabology 分享只是给 Opus 5.5 一段别人分享的提示词,配上 Midjourney 和一份情绪板,然后等了 12 个小时,就生成了。
截至 9 月 29 日,这条帖子已经获得超过 1800 万次浏览。作者在完整提示词方案和制作手册里补充,作品的配乐来自 Suno,画面、音乐、工具和提示词各有来源,但最后把这些内容结合生成视频的正是 Opus 5.5。
按他的记录,用 Claude Code 组织了这整套制作流程花费的时间,不止是 12 个小时,从第一条消息到最终调色版用了约 19 小时,人工发了约 50 条消息。
具体的分工包括策划和歌词、歌曲、人物和场景、动态镜头,以及剪辑字幕特效等内容。

其中,他使用 Claude Code 调用多个 agent 搜集科技圈素材,分别写词,再评选、合并和修改,接着用 Suno 生成歌曲,Midjourney 负责生成图像,选出素材作为镜头底图;再通过 Seedance 2.5 接收图像和歌曲片段,生成角色动作与对口型画面。
大模型 Claude 就负责编写 JavaScript,把画面、逐字歌词、图形动画按歌曲节奏组合起来。以及他自己再决定风格、选角色、审分镜,指出口型、重复镜头和调色问题。

图|使用 Opus 5.5 花费了 626 美元的 API 价格
我们在信息流里看到的是成片,最容易漏掉的恰好是制作过程中这些人的判断。
有网友在评论区表示「我们到底是怎么取得这么大的进步的?难道我在 2025 年到 2026 年之间错过了一年?我也在做这件事,但我要花好几天时间。」
另一个网友 NotinReality 也用 Claude Opus 做了一个视频,他给一首讨论 AI 风险的歌曲配上了卡通动画:角色、场景和字幕随着音乐变化,画面带着手绘感。
作者表示 Claude Opus 5.5 是他目前测试过的所有模型中,视觉设计最好的。
而在开源的详细制作指南里,他也提到了这是 Claude 把一首已有歌曲编排成了九章手绘风动画,并写出整套渲染程序。
类似的手绘风动画案例还有很多,Kevin Ngo 做了一支约半分钟的动画。城市里的人不断向 Claude 发送请求,一个女孩却写了一封信问它:「你喜欢什么?」。
视频里纸张拼贴般的夜空、小镇和人物,每一帧都由 JavaScript 绘制。

Kevin Ngo 的另一件作品,还被 Claude 官方转载,放在了创作者合集里。他用 Opus 5.5 制作了一个西瓜的视频,蚂蚁在巨大的西瓜表面爬行,画面依然通过 Claude 编写的 JavaScript 代码来保留纸张纹理和手绘笔触,整段只有约半分钟。

模型能承担的工作,已经延伸到作品的编排和制作过程。它可以把一个创作要求拆成分镜、图形和动作,也可以编写程序,把外部工具生成的素材组织起来。
这也是这一代通用模型一个很明显的变化:它开始从「帮你完成某一个步骤」,进入一整条创作流程。
模型的价值因此也越来越难只看单项生成质量,它能不能理解目标、拆任务、调用不同工具,再把素材拼成一个完整作品,同样成为能力的一部分。
3A 大作的游戏
3D 大概是今年大语言模型必不可少的代码测试,从去年的一句话做一个网页,到今年动不动就是做个 3D 网站,就连 Three.js 官方都发文,2025 到 2026,3D 库 Three.js 的安装量是直线上升。

Opus 5.5 的热门案例里,除了视频生成,出圈的也就是 3D 项目。X 博主 Shikhar 把 Blender、图像生成和 Three.js 接入制作流程,做出了一个可以蛛丝摆荡、沿墙奔跑的城市游戏。
还有网友用 Opus 5.5 制作了一个受《塞尔达传说:旷野之息》启发的游戏,一根巨型画笔既能当武器,也能用来飞行;红色是放火、蓝色是冻结、黄色弹跳、绿色长出藤蔓。
不同的颜色对应着不同规则。这些游戏的想法,被逐渐加进探索、战斗和地牢解谜里,模型需要把描述转换成具体行为,再让这些行为与地图、敌人和谜题发生关系。
Stefan 给模型接上 Unity、Blender 和生成工具,消耗了 Max 20x 的一周额度,API 等值用量花费 2175 美元,做出了一款老式 MMO 风格的角色扮演游戏。
作者称项目运行了 36 小时才完成,当把 Opus 用于这种规模的任务,额度已经是制作条件里必须考虑的一部分。
即便运行时间不需要 36 小时,有网友耗时 49 分钟,也花费了 177 美元,使用 Claude Sonnet 5.5 完成了一枪秒杀的僵尸游戏。
这款第一人称的僵尸射击游戏,枪械、夜景、敌人和任务界面都完全符合游戏作品的设计,Sonnet 5.5 能承担的任务基本和 Opus 5.5 相当,且作者提到他使用的推理等级还是 Max,成本也比 Opus 5.5 要低。
虽然这些游戏当然离真正的 3A 大作还有很远,但它们已经和前几年「一句话生成一个小游戏」有明显区别。
真正增加的复杂度,不只是画面从 2D 变成了 3D,角色移动、物理规则、地图、战斗、资产和界面之间都要互相配合,一个地方修改之后,还可能牵动整个项目。
模型除了要会写 Three.js 或 Unity 代码,还需要在越来越长的任务里维持一个完整项目。
专业级的 3D 资产
3D 游戏之外,需要现实规律对照的 3D 知识网页,也是 Claude 5.5 的热门案例之一。
Ryan Sael 用 Opus 5.5 通过搭建一个交互式镜头实验室来解释相机对焦。在这个 Opus 5.5 生成的 3D 互动网页里,镜头可以展开,对焦位置可以拖动,光圈能在 f/2、f/5.6、f/16 之间切换。

图|体验网址:https://lens.lab.sael.net/
同时,生成这个项目花了 1 小时 26 分钟,API 费用为 25.66 美元。
类似的案例还有网友做了一套 Raptor 3 火箭发动机交互演示,我们可以剖开结构,沿着氧气和甲烷的管路观察流动,再调节推力,查看喷流中菱形结构的变化。

更有意思的 3D 机械是这条沙虫,Dilum Sanjaya 把《沙丘》沙虫,用 Opus 5.5 做成了一条机械沙虫。这条机械沙虫有分节躯体、内部构件,再加上工程图式的界面,看起来就像一份可以浏览的科幻机械设计方案。
这类虚构题材又给了模型更大的设计空间,Opus 5.5 可以把机械零件、界面布局和三维运动组织成一种可信的视觉风格;这种专业感本身就是模型能够生成的效果。
之前测试模型时,我们总是喜欢让它们写一个 Mac、Windows 电脑出来,点击网页就能得到一个系统 UI 一样,能玩游戏、写记事本的云电脑。
现在的测试进阶到做一个 3D 真实云电脑,这台 NAND-16 让 Opus 5.5 操作了 30 个小时才得以生成,通过编写 JavaScript 代码,模拟了 277248 个与非门,再向上搭建 CPU、系统和小游戏等。

图|体验地址:https://somethingbig.ai/computer
更真实的模拟是用 Sonnet 5.5 生成的一段航船与海浪的动态场景。这个 3D 网页把船只、起伏的水面和光照都做到了极强的真实感。
作者还表示「Sonnet 5.5 基本上就是 Opus 5.5,但价格便宜 50%,速度也快得多。」

在这条帖子下,他还使用 Sonnet 5.5 克隆了糖豆人游戏、模拟了 3D 的旧金山、SpaceX 的星舰模拟,以及乐高搭建等项目。




向左滑动查看更多内容
3D 也因此成了这一轮模型发布里最容易出圈的一类 Demo。
相比一段代码有没有少几个 Bug,一个 Agent 连续工作十小时有没有忘记最初的要求,一条会动的沙虫、一片实时起伏的海面,几秒钟就能让人看懂模型变强了。
于是到了今天,一款模型发布之后,我们除了等官方 benchmark,也越来越习惯等另一套成绩单:X 上会出现什么样的游戏、3D 世界和动画。
爆款 Demo,也成了 benchmark
观察 Opus 5.5 这些爆火的几种类型案例,我发现 Demo 本身也在慢慢变成另一种模型的 benchmark。
只是它的评分标准从准确率变成了播放量、点赞和转发。3D、游戏、动画天然占优势,因为它们足够直观,也足够好看;一个模型在几十万行代码里少犯一次错、在连续工作几个小时后仍然记得需求,反而很难被剪成十几秒的视频。

于是一种有意思的变化出现了:我们曾经嫌 benchmark 离真实使用太远,开始去看用户真正做出来的东西;可当这些作品进入信息流,它又会被平台的传播机制筛选,最后留下来的往往是最直观、最好看的那部分能力。
榜单把模型压缩成一个分数,爆款 Demo 把模型压缩成一个瞬间。

Anthropic 自己也在 Opus 5.5 的发布稿里承认,基准成绩之间的差距,已经越来越难直接解释现实使用中的差异。
所以 Demo 当然还要看,而且可能会越来越重要。只是当它也成为模型的一张成绩单,我们需要看的就不该只有最后那个最惊艳的画面。
一个 Demo 告诉我们模型已经能做到什么,而它背后的时间、成本、工具和修改过程,则告诉我们,这种能力究竟成熟到了什么程度。
真正决定一个模型好不好用的部分,是那些惊艳的 Demo,能不能慢慢变成一种普通人也可以稳定获得的能力。







