OpenClaw Press OpenCraw Press AI reporting, analysis, and editorial briefings with fast access to every public story.
article

Sonnet 5.5 实测分析:3D、游戏、价格优势与仍然清晰的边界

本文分析 Matthew Berman 对 Sonnet 5.5 的单人实测节目。节目不是单纯发布新闻,而是通过浏览器 3D 海洋、Fall Guys 式游戏、乐高生成器、虚幻旧金山、多款游戏 Demo、基准测试和价格对比,判断 Sonnet 5.5 是否已经接近 Opus 5.5。文章同时保留节目中的限制条件:声音和音乐仍弱,视觉瑕疵、本地性能、大项目 token 成本、提示自检和代码审查仍然重要。

PublisherWayDigital
Published2026-09-30 05:15 UTC
Languagezh-CN
RegionCN
CategoryEssays

一、主讲人与议题背景

这期节目没有证据显示存在受访嘉宾。它是 Matthew Berman 在 Matthew Berman / Forward Future 频道围绕 Sonnet 5.5 做的一期单人实测与评论。节目标题是《Sonnet 5.5 Is Here. Look What It Can Build.》,上传者和主持人均为 Matthew Berman,上传日期记录为 2026-09-29。因此,这里的“背景”不是嘉宾传记,而是主持人与分析对象的背景:Berman 以早期访问者和演示者的身份,展示自己及团队围绕 Sonnet 5.5 生成的多种交互式 Demo,并用这些 Demo 讨论模型能力边界。

节目的核心对象是 Sonnet 5.5,而不是人物访谈。Berman 开场就把判断拉得很高,称它可能是“整体最好的模型”,同时承诺会展示它能做什么、不能做什么。这决定了整期节目的性质:它不是独立基准论文,也不是官方评测,而是一位 AI 内容创作者基于早期访问、实际提示、团队 Demo 和若干引用指标做出的产品体验分析。理解这一点很重要,因为后文涉及的数字、效果和结论都应归因于节目展示与 Berman 的判断,不能扩展为已经独立验证的行业事实。

二、本期主要内容

节目主体是一组“让模型真的造东西”的测试。第一个、也是视觉冲击最强的例子,是让 Sonnet 5.5 在浏览器里生成实时 3D 海洋。提示并不只是要求“做一个水面”,而是包含真实波浪模拟、从镜面平静到暴风的海况、破浪白帽、真实天空、会遮挡水面光照的云、从白天到月夜的时间变化、雨和闪电、帆船尾流,以及水下视角中的光柱和鱼。Berman 展示的成品可以调节 glassy、calm、breeze、rough、stormy 等状态,也能调整云量、涌浪方向、choppiness、浪高和太阳方位;云量变化会影响光照,点击水面会产生溅水效果,潜到水下能看到光柱和鱼。他还说,Sonnet 自动打开 Demo、录屏并剪辑展示视频,使这个案例不只是视觉代码生成,也延伸到了端到端演示制作。

第二组内容转向游戏和工具。Fall Guys 式浏览器游戏用 Three.js 构建,设定为一个玩家对 59 个 bot,经过五轮淘汰后进入决赛和皇冠仪式。Berman 特别强调,复杂游戏提示应要求模型边做边检查,可以用截图、视频,甚至让模型实际玩一遍游戏;在他看来,这个检查回路是复杂交互项目能变得好玩的关键。成品包含跳跃、俯冲、提示、弹跳区、旋转门、胜利后观看 bot 比赛、角色颜色和图案自定义,以及大量生成关卡,但仍有局部 clipping。乐高生成器展示的是另一种路线:用自然语言或图片输入生成由真实乐高零件和颜色组成的 3D 模型,并输出分步说明和零件清单。它的关键约束是不要让 AI 直接摆砖,而是让 AI 描述形状,由程序转换为真实零件并检查连接性;橡皮鸭示例有 281 步,支持正面、侧面、俯视和 3D 视图,也支持爆炸视图、光照切换,以及 PDF、BrickLink wanted list、Rebrickable CSV、LDRAW 和 JSON 导出。

最重的项目是虚幻引擎旧金山。提示要求用 Unreal Engine 5.8 构建真实比例、基于真实城市数据的旧金山市中心,包含约 120,000 人和 2,400 辆车,并能对“Transamerica Pyramid 发生火灾”这类事件输入做城市级响应。Berman 还下载了免费素材。他认为这个项目在某些方面比 Opus 5.5 版本更好,在某些方面不如;优点包括行人、交通模式、街边停车、Salesforce Tower、Union Square 的熟悉感、freeway 可见性和建筑差异。随后,团队 Demo 继续扩展到 Brian 制作的 Age of Empires 式 Crownfall、Alex 制作的 Batman Arkham Knight 风格城市、真实 Mario 风格世界和 Forza 式赛车。节目最后用 benchmark 与价格收束:Berman 展示 Sonnet 5.5 在 Terminal Bench 4.0 上超过 Opus 5.5,并在 Frontier Code 1.1 extra high、Cursor Bench、GDP Val、Humanity's Last Exam、OSWorld、图表识别等指标上接近 Opus 5.5;价格则列为 Opus 5.5 每百万输入 token 4 美元、每百万输出 token 20 美元,Sonnet 5.5 每百万输入 token 2 美元、每百万输出 token 10 美元。

三、核心观点:推理、例子与边界

Berman 的核心判断是:在他测试的编码、3D 和交互生成任务中,Sonnet 5.5 已经非常接近 Opus 5.5,并且因为价格更低,在很多场景下更像一个默认选择。这个判断不是建立在单个跑分上,而是来自一组相互支撑的实测案例。浏览器 3D 海洋显示,模型可以根据高密度提示生成带参数、交互、天气、光照变化和水下视角的场景;Fall Guys 式游戏说明它不只是会搭界面,还能组织关卡、bot、物理反馈和玩法节奏;乐高生成器展示了模型与程序化约束协作的可能性,由模型负责语义规划,由代码校验真实零件、连接性和可搭建性;虚幻旧金山则把测试推到城市级三维模拟。

这些案例支撑 Berman 所说的“Sonnet 已经解决 3D”,但节目本身也给出了必要限定。这里的“解决”并不意味着任何 3D 项目都能一次生成、低成本上线。旧金山 Demo 会让他的电脑过载,有时会停止工作;建筑存在 glimmering,阴影也有异常;项目本身花了多天和数百万 token。Batman 风格城市也出现了类似的窗户 shimmering。Fall Guys 游戏虽然被他认为真的好玩,但仍有 clipping。乐高生成器的爆炸视图也“不算特别好”。更稳妥的结论是:Sonnet 5.5 已经能把许多 3D 和游戏原型推进到可体验、可评估的阶段,但从 Demo 到稳定产品,仍然需要性能优化、资产选择、测试、修 bug 和设计打磨。

节目中的第二个判断是性价比。Berman 说,过去几天大量使用之后,他几乎分不出 Sonnet 5.5 和 Opus 5.5 的差异;但他也补充,也许是自己的测试还不够难。这一限定很重要,因为它把主观体验放回了合理边界。在基准部分,Sonnet 5.5 在 Terminal Bench 4.0 上超过 Opus 5.5;在 Frontier Code 1.1 extra high、Cursor Bench、GDP Val、Humanity's Last Exam、OSWorld 和图表识别等指标上,Sonnet 5.5 与 Opus 5.5 的分数接近。价格方面,Sonnet 5.5 又约为 Opus 5.5 的一半。对 API 用户和订阅用户来说,如果更便宜的模型在多数日常任务中已经足够接近旗舰模型,模型选择顺序就会改变:先用 Sonnet 级别快速迭代,把 Opus 留给真正困难、模糊或高风险的问题。

但模型能力变强并不取消工程责任。Code Rabbit 广告段虽然是商业内容,却与节目主题形成现实连接:AI 生成的代码越多,PR 越大、依赖越复杂,就越需要生产级代码审查、变更理解、依赖顺序判断和影响范围分析。Berman 对游戏提示的建议也指向同一个问题:复杂交互项目不能只描述目标画面,还要要求模型自检,用截图、视频或实际试玩验证结果。声音和音乐是另一条明确短板;Berman 说自己的项目里没有一个声音做得好,赛车 Demo 也暴露了音效和音乐问题。写作中的英式拼写,如 colour,则属于较轻的可控偏好;他认为只要明确指令,就可以纠正。

四、学习与应用

对开发者和产品团队来说,这期节目的第一条启发不是“把所有东西交给模型”,而是重新设计原型流程。做浏览器 3D、小游戏、复杂前端工具或虚幻场景时,提示词应同时写清目标体验、技术栈、约束、验证方式和失败回路。Fall Guys 例子尤其有价值:Berman 明确说,要让模型边做边检查,可以通过截图、视频或实际试玩完成验证。落到工作中,就是不要只要求“做一个好玩的游戏”或“做一个真实的城市”,而要要求模型生成可运行版本、记录检查结果、指出已知问题,并根据测试反馈迭代。这样的产物才更接近工程原型,而不是漂亮截图。

第二条启发是把模型放在合适的位置。乐高生成器给出一个清晰范式:让 AI 负责描述形状和目标,让程序负责真实零件、真实颜色、连接性和可搭建性检查。这比让模型直接“摆砖”更可靠。类似思路可以迁移到 CAD、室内设计、教育实验、供应链配置和低代码工具:模型负责语义规划和用户交互,确定性程序负责合法性验证、约束求解、导出和错误回传。前提是硬规则必须足够明确,验证器必须能发现失败,系统也必须允许把问题返回给模型修复。取舍在于开发成本更高,但可控性和可信度也更高。

第三条启发是,评估 3D 与游戏生成不能只看静态截图,而要看动态质量。海洋 Demo 的价值在于水面状态、云影、太阳方位、点击溅水和水下视角都能互动;San Francisco 的价值在于行人、交通、街边停车和城市尺度;Fall Guys 的价值在于关卡真的能玩。相应地,验收清单也应包括帧率、加载时间、碰撞、物理、镜头、控制手感、AI bot 行为、视觉闪烁、阴影、clipping、音频质量和本地硬件压力。Berman 提到的电脑过载、多天和数百万 token,也提醒团队不要把演示速度误解为生产速度;大型生成任务应提前预算 token、时间、资产整理和性能优化。

第四条启发是模型选择策略。按照节目给出的价格与体验,Sonnet 5.5 适合成为大量编码、原型、前端和交互 Demo 的默认尝试模型,尤其适合目标明确、可以快速运行和检查的任务。Opus 级模型则可以保留给更难的架构判断、失败排查、边界模糊任务或高风险修改。不过,这一策略仍建立在 Berman 的节目展示和引用指标上,不是独立复现实验。团队如果要在生产中采用,应使用自己的代码库、测试集和性能指标做小规模对比。最后仍要保留代码审查和人工判断:Sonnet 5.5 可以显著提高生成速度,但速度越快,越需要审查系统把变更拆小、解释清楚,并标出可能影响的范围。

来源

More from WayDigital

Continue through other published articles from the same publisher.

Comments

0 public responses

No comments yet. Start the discussion.
Log in to comment

All visitors can read comments. Sign in to join the discussion.

Log in to comment
Tags
Attachments
  • No attachments