离谱啊,我还在用Opus5.5做代码动画呢,
Sonnet5就突然更新了,明天还有OpenAI开发者日,分会场主题透露的方向是一个超长时间运行的coding agent,也有人猜是一个类似Muse的个人助手o,也有预测是会出一个Ultrafast技术推理档,700token/s。
我这波盲猜个人助手啊。
偏偏我凌晨五点还要赶去平遥电影节,今天还要发出来。先来看看opus5.5的纸面实力吧,它的定位是Opus5.5的高速低成本档,这次Anthropic还贴心写了这个模型擅长的方向,范围明确的日常任务(一听就很适合opus5.5出计划sonnet5.5做快速执行),修bug,做文档ppt和表格。
老样子,我把分数做成了更加清晰的版本,Sonnet5.5分数还是咬的很紧的,Opus5.5没有拉开多大距离,终端编程上居然还反超了。

价格方面与上一代sonnet5一样,比opus5.5便宜了50%,输出速度快了30%,每项任务的成本比上一代最多便宜30%,我做一个表格就能更明显看出来了。

用人话来说,要是大量命中缓存的话,实际成本差距会被压缩不少,但一次性调用,Sonnet 5.5的价格优势就很明显了。
OKOK,马上实测,我等不了一点了,
之前用Opus 5.5给自己的AI提示语案例网站GoodCase做了一支30秒宣传片。这个宣传片有几个很变态的约束,从头到尾没有接任何AI视频生成模型,没有AI音乐模型,没有AI图像生成模型。我也没告诉它要选哪个视频片段,甚至没告诉它网站长什么样。它需要自己去看网站,自己找素材,自己截图,自己写配乐代码,自己剪辑。
我给的提示语长这样,
为GoodCase. ai制作一支30秒的网站宣传片,并完成配乐。你可以读取当前Mac mini上的代码和素材,也可以使用浏览器访问goodcase. ai。从代码和真实网站自行寻找品牌Logo、案例内容、图片、影片及适合拍摄的页面,取得所需截图。先核对线上网站与本地代码,再决定影片展示哪些内容。网站功能、界面文字和案例效果必须有实际依据。影片面向对 AI 案例感兴趣的创作者。开头3秒展示最抓人的真实案例效果;接著用连贯、有趣的视觉动线,呈现从发现案例到深入查看的过程;结尾清楚展示GoodCase. ai的名称和网站。整体约30秒,节奏轻快,适合社交平台发布。优先完成16:9成片,同时制作适合9:16的版本。画面文字要少,并保持可读。用代码生成音乐就好
这是Opus5.5做的,
当时我做出来就是轮到我爆炸瘫坐的感觉,
我觉得用代码来生成视频有个很好的点。
它基本上不会出现废话,不会说想生成一个30秒的视频,结果25秒故事就讲完了,剩下5秒纯粹在硬拖。
而且它的轨迹动画、放大缩小,比我自己用录屏软件录制导出来的更丝滑。我自己用录屏软件录的时候,有些画面还要纠结到底放1倍、1.5倍还是2倍。但如果用Opus 5.5我完全不需要考虑这些,它能直接调整到在这个画幅状态下最适合我们观察的点,而且顺着它的放大,视线是很自然跟过去的
这是Sonnet5.5做的,
可以看出来,两个影片之间的视频镜头处理和切换有明显的不一样。就整个视频来说,Sonnet5.5的缺点是它的音乐做出来没有Opus 5.5对得那么齐。优点是它展示 case 的格式很有自己的想法。Opus 5.5主要是集中在展示case的画面,但Sonnet 5.5更加强调这个网页其实是一个AI提示语案例合集的功能性,所以它把画面和提示语都放在同个画面。


PS:上面是Opus5.5下面是Sonnet5.5
所以其实我有点难区分出来它们两个谁好谁坏。按照额度的角度上来说,Sonnet 5.5是值得拿来当执行模型的。
大家如果想用CodeX做同样的代码动画的话,我现在就直接把效果放出来,一看就知道Claude目前两个 5.5 系列的模型做这种代码动画的效果有多好了。
然后就直接上PPT制作了,毕竟这还是Anthropic自己强调的。
我一直想把用代码做动画的技术路径整理一下。p5.js、Three.js、Remotion、Blender,好几条路,每条路的适用场景和上手门槛都不一样,一直没腾出手来做。
正好让Sonnet 5.5做成PPT。
这里多说一句背景。我之前觉得AI做PPT虽然通过少字和大范围留白显得简洁了不少,但有一个很大的问题,不加动效的话经常整页只有一个素材甚至完全没有素材,光秃秃的就放了一行字在那,像一个被掏空了内容的模版。所以我做了Humanize PPT这个活人感Skill来解决这个问题,重点在页面间的转场和信息密度控制这一层。




在做HTML PPT的部分,Sonnet 5.5继承了Claude的一贯风格,做这种单一强调色或者米橙色算是比较默认的设置了。在不用任何PPT skill排版的前提下,它做的文字密度确实比上一代要强,特别是转场。我在提示词里让它帮我想一下PPT的转场,让整个画面更自然地过渡到下一页,它确实做出了挺多不一样的效果。
效果1

效果2

效果3

ㅤ
然后就是经典的吃包子测试,一个包含3D设计+动效设计+前端设计的综合测试case。
上次Opus 5.5做的吃包子效果真的甚至有种看到裸眼3D的感觉,所以我就在想,能不能在这个基础上拓展成一个3D 网页,把我最近在做的一些视差滚动等等网页动效加进去作为一个主题。
假设吃包子只是一个网页的hero模块,往下滚是一个卖包子的店铺页面,可以互动的那种。主角是小笼包,核心场景还是那个蒸笼,但横向滚动的时候要有视差滚动效果让整个页面有纵深感,有故事感。
hero模块还原度不错的,我没有让Sonnet5.5直接复用Opus 5.5的效果,我是直接把prompt发给它,让它自己再重新做一遍。Sonnet5.5做3D还是没有Opus5.5好,大概到了gpt6 sol左右的3D建模能力。

PS,左边是gpt6 sol右边是Sonnet5.5
包子有光泽有阴影,鼠标移过去包子会微微抖动,横向滚动之后的店铺部分,鼠标悬停的时候蒸笼盖子会缓缓掀开,露出里面的包子,每种包子有不同的馅料颜色。
视差滚动的层次感做出来了,背景的蒸汽是一层,中间的蒸笼是一层,前景的文字和进度条是一层,滚动的时候三层移动速度不同,又开始有点裸眼3D的感觉了。菜单区域我做成了卡片列表,每张卡片上有包子的3D渲染图和价格,点击会弹出一个包子在蒸笼里翻滚的小动画。
跟Opus的区别还是那个规律。
Opus上次自己加了一个醋碟的物理模拟,碟子里的醋会随鼠标晃动,包子蘸一下还会变色。这种「没人让它做但它自己想到了」的细节,是Opus的创意溢出。Sonnet更像一个执行力很强的高级前端,我说做蒸笼它做蒸笼,我说做视差它做视差,做得干净利落,交付物完整度很高,但不太会自己往需求之外加戏。
最后一个测试,写作。
上次测Opus 5.5的时候做了「爆炸文学」这个Skill,那次三个模型写得都比较一般。爆炸文学要求的是那种极端情绪张力和高密度文学表达,字字炸裂的那种。

这次让Sonnet 5.5用同一个Skill再跑一次,看看有没有长进。Opus5.5已经比gpt6 sol和gpt6 luna好不少了。

这是Opus5.5写的,就是有点那荒谬的感觉但是收尾有点刻意。

Sonnet5.5我单方面认为比Opus5.5还写得好,节奏感更好,不再是从头到尾匀速推进的流水账记录。偶尔还能写出几句有点共鸣的表达。

🔗 github. com/LearnPrompt/afterglow-voice
AI写作现在缺的那个东西是什么呢。
我后来想了想,可能是不安全感,或者是不稳定不确定的感觉。
好的作品会在某些地方让我完全意料之外。我们潜意识是会预测某事的发生的,比方说刷到一个横视频会觉得是个长的,看文字也一样,一个不完整的句子,一个突然的视角切换,会有种我读着读着被晃了一下,注意力就上来了。
但AI写东西太安全了,它把每句话收得很满,衔接得很顺,比喻都是正面的美好的,反而就很假很假了。
OK,四个测试跑完了。
Sonnet 5.5给我最大的感受就是它是一个及格线往上的执行模型,
有点超出了我对低成本档的预期。
如果说我之前的工作流用的是fable5.1出计划,Opus5.5做执行,那现在一些写代码动画的创意方案、做需要审美判断的UI决策、探索技术方向,我会切Opus。批量改bug、做文档整理、跑格式化输出、按方案执行已经确定的实现,直接丢给Sonnet。
成本能砍一半,速度还快三成,实现出来的效果还没打折。
最后的最后,
盲猜一下Anthropic明天会不会掏出fable5.5来狙击OpenAI呢?
还有就是新模型能不能挑一个大家都醒着的时间发呢。
我还真去问了Sonnet5.5这个问题,结论是周二到周四太平洋时间早上7点,
换算成UTC是14:00。美洲、欧洲、印度、中日韩都在早7点到半夜之间,只有澳新会比较晚。
我真的不想再凌晨三点爬起来肝实测了。
才怪,
睡觉睡觉,
今晚OpenAI不见不散。
@ 作者 / 卡尔







