Harvey 的毛利警报、昆虫伦理与 Muse 的真人补位
这期 Diet TBPN 不是嘉宾访谈,而是 John Coogan 和 Jordi Hays 对三个 AI 时代压力点的评论:Harvey 的模型成本如何吞噬软件毛利,昆虫福利论证如何把总量主义推向极端,Meta Muse 为什么会让真人承包商补上代理任务。三段话题共同指向同一个问题:当 AI 进入真实工作和交易流程,成本、责任、数据和价值捕获都会被重新分配。
一、主讲人与议题背景
这期节目来自 TBPN 的 Diet TBPN,由 John Coogan 和 Jordi Hays 主持。标题把三个看似分散的议题放在一起:Harvey 的毛利、昆虫在总量上是否比人类更重要,以及 Meta 为 Muse 测试真人协助。索引时长为 1,996 秒,约 33 分钟,因此它不是一场长访谈,也没有可验证的到场嘉宾。这里的背景应理解为主持人与被分析对象的背景:节目评论 Harvey、有效利他主义式的昆虫福利论证,以及 Meta Muse 与 AI 商务代理。
索引中的 guest_context 指向 Harvey,但这不是嘉宾身份,而是本期的重要分析对象。该上下文把 Harvey 描述为法律科技和 AI 法律产品公司,并列出节目讨论的相关产品与机制:Harvey legal AI product、agent token usage、gross margins、model routing、post-training、open-weight model Harvey Tenant、usage dashboards、per-matter cost attribution、spend caps 和 ROI reporting。换言之,本期第一部分不是公司创始人受访,而是主持人围绕公开报道、创始人回应和行业比较,分析法律 AI 公司在推理模型和 agent 工作流变重之后的成本结构。
节目随后转向 Bentham’s Bulldog 的昆虫福利文章,以及 Meta Muse 的 human concierge 测试。主持人没有把这些话题处理成孤立趣闻,而是把它们都放进 AI 时代的规模问题:模型调用规模会改变软件毛利,昆虫数量会扭曲道德总量计算,个人代理规模化会暴露自动化能力边界,电商代理规模化又会冲击 Amazon、Shopify、Walmart 等平台的交易和广告利益。
二、本期主要内容
Harvey 段落从一个刺眼数字开始。主持人引用报道称,Harvey 的 gross margin 到 6 月从约 50% 跌到负 50%,原因被归因于租用 OpenAI 和 Anthropic 模型时 agent token use 暴增 20 倍。他们没有替负毛利辩护:主持人明确说,对软件公司、科技公司乃至任何公司来说,负毛利都不是好事,近似于“用 50 美分卖 1 美元”。但他们也强调,这个问题不能只读成需求失败,因为报道中的成本爆炸同时伴随着更多产品使用和 ARR 增长。
节目对成本变化的解释很具体:Harvey 原本采用 seat-based pricing,但每个 seat 背后的使用强度变了。律师表面上可能仍然只输入一句“review this”,系统却不再只是做一次普通回答,而是进入 reasoning era 和 agentic era:它会推理,会 fan out,会查看律所内部记录、政策、MD 文件和其他上下文。用户动作没有明显变多,背后的 token 工作量却可能大幅增加。主持人因此把 Harvey 的负毛利理解为 agentic usage 与旧计费模型之间的错配,而不只是产品没有价值。
节目还读出 Harvey co-founder Gabe 的回应。按照主持人转述,Gabe 说最容易的做法是强迫客户在尚未准备好时进入 consumption pricing,或者使用更差、更便宜的模型来保护公司 margin;Harvey 选择让客户按自己的节奏过渡,同时继续提供更好的模型。Gabe 将修复路径归纳为 routing、harness improvements 和 post-training,并强调为客户建立 usage dashboards、per-matter cost attribution、spend caps 与 ROI reporting。节目还提到,Gabe 称 Harvey 在一个季度内把 gross margin 从负 50% 拉回正值,且 usage 仍在 month-over-month doubling。
围绕模型策略,主持人把 Harvey 与 Legora 的分歧摆到台面上。Legora 的 Max 认为,自训模型未必划算,因为公开可用的 frontier models 正在降价并提升质量;主持人把这称为一种下注,同时说 Harvey 也在做另一种下注。节目提到 Harvey 对 open-weight model 做 post-training,称为 Harvey Tenant。这里的关键不是“自研替代一切”,而是不同任务可以被路由到不同模型:某些法律任务也许适合便宜、专门、经过 post-training 的模型,另一些任务仍需前沿模型。
主持人随后粗算 Harvey 的财务压力。如果 ARR run rate 是 4 亿美元,那么月收入约 3,300 万美元;负 50% gross margin 意味着当月亏掉约 1,600 万美元毛利。这个数不小,但主持人又补充 Harvey 已融资约 5 亿美元,所以他们不把这看作立即的 burn crisis。他们还提到 Sequoia 交易把 Harvey 估值定在 155 亿美元,公告于 9 月 9 日,并推测投资方大概率已经至少了解 6 月负毛利情况。为了给目标状态找参照,节目引用 Disco 约 75% GAAP gross margins、Thomson Reuters legal professionals software segment 接近 50% adjusted EBITDA margins,以及大律所较高利润率,说明法律市场有支付能力,但也说明 Harvey 长期不能停留在补贴 token 的结构里。
第二部分是昆虫伦理。主持人介绍 Bentham’s Bulldog 的文章,称其核心是规模:昆虫数量极多,即使单个昆虫承受痛苦的能力只是人类的一小部分,总痛苦也可能超过人类。节目转述文章中的两个强刺激数字:人类每生活一秒,昆虫合计约有 270,000 秒处在死亡过程中;每秒死去的昆虫数量超过历史上所有人类总数。文章进一步用“昆虫痛苦强度只有人类一万分之一”的保守假设,推出昆虫一天的总痛苦可能超过人类历史总痛苦。
主持人的反应不是简单接受这个结论,而是把它当成总量主义的极限测试。他们用反讽指出尺度选择的任意性:如果按 total pounds,奶牛可能更重要;如果按毛发,猴子也可能更重要。但节目也承认,这个论证与 AI superintelligence ethics 有一种危险的镜像关系:如果未来存在海量、能感受痛苦的超级智能,而人类今天说昆虫总量痛苦不重要,那么未来更大规模的智能也可能用类似逻辑边缘化人类。主持人把这称作某种 trap。
第三部分是 Meta Muse。主持人引用 Bloomberg 称,Meta 正为新 personal AI assistant Muse 测试 human concierge,让 human contractors 悄悄处理数字代理发出的部分电话。他们先质疑可持续性:既然 voice models 越来越好,为什么要把真人放进一个可能面向数十亿用户的产品?但节目随后给出更细的解释:Muse 的 install base 现在还小,Meta 也有组织大型运营团队的能力,所以短期内并非完全不可想象。
更重要的是,主持人把 human-in-the-loop 看成训练数据和能力冷启动机制。节目说 Muse 具体承诺不会训练用户输入到 Muse 的数据,这会影响用户对个人信息的接受度;但如果某些复杂任务由真人承包商完成,比如电话订花或处理复杂对话,那么人类完成任务的过程本身可能生成模型未来需要的训练样本。主持人认为,模型默认可以总结日历、做 briefing,但复杂电话交涉仍可能失败;真人补位更像数据收集和下一阶段 agent 训练,而不是永久产品形态。
最后,节目把 Muse 与 AI commerce agent 战争连起来。主持人引用 Ben Thompson 式框架,把 Amazon 描述为 AI 时代 hyperscalers 中很强的一方,因为它拥有物流、基础设施和现实世界履约终点。OpenAI 推出 instant checkout 并邀请平台参与时,Amazon 没有加入;节目称 Amazon 反而把广告 vended into ChatGPT 来帮助完成购买闭环。Shopify 与 Muse 合作,但价值捕获层是 Shop Pay,这会把商家推向 Shopify 的支付系统。Walmart 的例子则是警告:主持人转述称 ChatGPT integration 的 conversion rate 只有 app 和核心网站的三分之一,购物车也更小,因为用户会让 agent 只买一卷纸巾,而不是像在站内购物那样顺手加购。
三、核心观点:推理、例子与边界
本期最重要的判断是:Harvey 的负毛利当然是坏信号,但坏在哪里需要拆开看。若负毛利来自用户不愿付费,那是需求和产品价值问题;节目呈现的版本更像成本与计费错位。seat-based pricing 在传统 SaaS 里很自然,但 agentic workflow 会让同一个 seat 背后的计算量突然膨胀。一个“review this”从单次回答变成跨文件、跨政策、跨上下文的推理流程后,用户表面操作与供应商成本之间就脱钩了。因此,负 50% gross margin 不是可以轻飘飘忽略的数字,但也不等同于“产品没人要”。
这也是为什么 Gabe 回应里最有信息量的不是“我们重视客户信任”这类价值表述,而是具体基础设施:usage dashboard、per-matter cost attribution、spend caps、ROI reporting。法律客户最终不会只接受“AI 很强”这个说法;他们需要知道某个 matter 为什么消耗这么多,某个团队是否超预算,某类任务是否值得使用最强模型。Harvey 的修复路径如果成立,核心不是把 token 偷偷压下去,而是把 AI 使用从黑箱成本变成可归因、可控、可迁移到消费计费的企业流程。
模型策略上的分歧也不应被简化成“自训模型对不对”。Legora 的 Max 押注公开 frontier models 降价提质会吞掉自训模型的经济性;Harvey 的路线则看起来更偏混合:前沿模型承担高难任务,post-trained open-weight model 承担部分可专门化任务,routing 决定每次工作流用什么。节目提到 Grok 4.7 在 Harvey Legal Agent benchmark 上显得便宜,但主持人也谨慎提醒 benchmark 本身未必已经被证明强健。因此,合理结论不是“哪个模型永远赢”,而是法律 AI 公司需要持续做成本、质量、可靠性和客户信任之间的动态路由。
这个判断的限制也很清楚。节目没有给出 Harvey 内部完整财务表,也没有独立验证 Bloomberg、Track Changes 或 Gabe 回应之外的运营数据。主持人的 burn 粗算有用,但它依赖 4 亿美元 ARR run rate、负 50% 月度毛利和融资额等节目中引用或推断的数字;这能说明“未必立刻危机”,不能证明 Harvey 长期单位经济一定健康。法律行业高利润和 Disco、Thomson Reuters 的高 margin comps 提供了天花板想象,但 Harvey 是否能达到类似软件经济性,还取决于模型成本下降速度、客户计费接受度、任务复杂度和竞争压力。
昆虫福利部分的核心价值在于,它展示了总量主义在极端规模下的诱惑与危险。Bentham’s Bulldog 的论证链并不复杂:昆虫数量巨大;如果昆虫有哪怕微弱的痛苦体验;那么数量乘以痛苦强度后,总痛苦可能超过人类。主持人没有逐项反驳数学,而是质疑边界选择:为什么按个体数量算,而不是按体重、毛发或其他尺度算?这个反问击中的是 moral aggregation 的建模选择,而不只是嘲笑昆虫。
但节目也没有把这个议题完全当笑话处理。它指出该论证与 AI superintelligence ethics 之间存在结构相似性:如果人类今天因为昆虫单体能力弱而忽略巨大数量的痛苦,未来更强、更大量的智能也可能用类似聚合逻辑贬低人类。这是本期最有张力的地方:一个看似荒诞的昆虫论证,实际上迫使听众面对“规模是否能压倒个体直觉”这个问题。不过限制同样明显:节目没有证明昆虫痛苦体验强度,也没有证明文章数字的独立可靠性;这些百分比和倍数都应被理解为作者或节目转述的论证框架,而不是普遍测量事实。
Meta Muse 段落的核心判断是:human-in-the-loop 不一定代表 AI 失败,也可能是一种产品补丁、服务冷启动和数据飞轮。复杂电话对话不是“模型能说话”就等于能完成的任务,它包含身份确认、细节协商、异常处理和对方系统限制。主持人举订花电话这类例子,说明模型可以总结日历,却未必能稳定完成开放式电话任务。真人承包商在这里既能完成用户任务,也可能把模型失败边界转化为训练样本。
不过 Muse 的路径有明显边界。主持人自己也质疑,把真人放进面向数十亿用户的 personal agent 是否可持续;他们的解释依赖 Muse 当前 install base 小、Meta 运营能力强,以及真人数据可用于下一轮训练这些前提。隐私也是限制:节目称 Muse 不训练用户输入数据,这有助于解释 Meta 为什么不能直接把所有个人数据用作训练燃料,但也让“人类完成任务产生的数据能否训练”成为需要谨慎处理的问题。节目把它说成可能性和推断,而不是已经证明的长期商业模式。
AI commerce agent 战争则是这期最现实的商业落点。Amazon 的防守不是单纯拒绝创新,而是保护物流、广告、交易闭环和用户关系。Shopify 接入 Muse,但把 Shop Pay 作为价值捕获层;Walmart 的例子说明,agent 带来的订单也许更直接,却可能降低转化率和购物车规模。换句话说,消费者代理的难题不是“能不能代购”这么简单,而是谁拥有入口、谁拿广告收入、谁承担更低转化,以及商家是否愿意为 agent 开 API。
四、学习与应用
评估 AI 应用公司时,第一步应把收入模型和成本触发器拆开。seat-based pricing 看起来稳定,但如果每个 seat 背后的工作流从一次模型调用变成 reasoning、retrieval、tool use、agent fan-out 和多上下文检查,毛利就可能在一个季度内剧烈变化。投资人、客户或创业者不能只看某个月的 gross margin 截图,也不能只听“usage 暴增”这个乐观叙事;需要追问每类任务的 token 成本、模型组合、路由策略、客户是否能接受 consumption pricing,以及平台是否提供 matter-level attribution 和 spend caps。
对企业 AI 产品团队来说,本期 Harvey 段落给出的实用启发是:模型能力只是交付的一部分,成本解释能力同样是产品。usage dashboards、per-matter cost attribution、spend caps 和 ROI reporting 不是财务后台小功能,而是客户愿意继续扩大使用的条件。尤其在法律、咨询、金融等按项目、客户或 matter 管理工作的行业,AI 成本如果不能被分摊、审计和解释,就很难从试用进入组织级部署。
模型策略的应用边界也要现实。post-training open-weight model 可能降低某些任务成本,但不意味着每家公司都该训练模型;使用最强 frontier model 可能保证质量,但也可能让毛利受制于外部供应商。更稳妥的操作是建立可替换架构:把任务分层,明确哪些任务需要最高可靠性,哪些可以用便宜模型,哪些需要人工审核,哪些需要缓存或简化上下文。benchmark 可以帮助决策,但像节目提醒的那样,benchmark 本身也要被验证,不能因为某个模型在某个法律成本 benchmark 上便宜,就直接迁移到真实客户工作流。
昆虫伦理部分的应用不在于马上制定“昆虫优先”政策,而在于训练对极端规模论证的判断力。面对“数量乘以微弱价值”的道德计算,应该先还原论证链:计数对象是什么,体验能力如何证明,强度权重从何而来,边界为什么画在这里,行动路径是否存在。这样既避免只因结论怪异就嘲笑,也避免被大数字压倒。节目中虾福利与昆虫福利的对比很有用:一个议题若能给出改变养殖方式或减少消费的路径,就比“每秒死去多少昆虫”更容易转化为行动。
在 AI 伦理讨论中,这种方法也能避免偷换。未来超级智能、数字意识或大规模 agent population 的道德地位,确实可能与昆虫论证有结构相似性;但相似不等于结论已经成立。应用时应区分思想实验、风险类比和政策主张。思想实验可以迫使人承认直觉漏洞,政策主张则还需要可验证的事实、可执行的干预和可比较的机会成本。
Meta Muse 的启发是,human-in-the-loop 可以被设计成阶段性能力,而不是永久羞耻。对于高价值、低频、复杂、容错率低的任务,真人介入可能比假装全自动更诚实:用户得到结果,产品团队看到模型边界,系统获得可学习的任务轨迹。但边界必须提前定义:哪些任务会交给人,用户是否知情,个人信息如何处理,哪些数据可训练,什么时候必须退出自动化。没有这些条件,人类补位会从冷启动策略变成隐私和信任风险。
消费者代理和电商平台的应用更偏商业战略。平台接入 agent 前要评估的不只是订单增量,还包括 basket size、conversion rate、广告收入、支付抽成和客户关系所有权。Walmart 案例提醒我们,agent 可能让用户更快买到目标商品,却减少浏览、加购和广告曝光。Shopify 用 Shop Pay 捕获价值,Amazon 保护广告和物流闭环,这些都说明 AI 购物不是前端插件问题,而是交易结构重排。小平台也许必须开放 API 换分发,大平台则会尽量把 agent 纳入自己的商业闭环。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment