Le Chonk 回来了:Mistral Large 4 的欧洲开源雄心与工具链现实
Matthew Berman 这期节目分析的对象不是人,而是 Mistral AI 的新模型 Mistral Large 4 / Le Chonk。他把它视为一个由欧洲从零训练、开放权重、具备竞争力的前沿模型,同时也通过价格、基准测试、网络安全表现和一次 Rubik's cube agentic 编程测试指出:强模型距离好产品仍有明显距离。
一、嘉宾背景
这期《Matthew Berman / Forward Future》由 Matthew Berman 主持,分析对象是 Mistral AI 的 Mistral Large 4,也就是节目中反复称作 Le Chonk 的模型。这里的“嘉宾”不是接受采访的人,而是被拆解的 AI 模型本身;证据中的 guest role 明确写为“AI model being discussed”。因此,这期内容应被理解为一次模型发布分析,而不是人物访谈。
Mistral AI 在节目语境中被描述为一家欧洲 AI 公司,方向是开放权重、开源前沿模型。Le Chonk 的“背景”也不是职业履历,而是产品与技术画像:它被称为一万亿参数、开放权重、开源、原生多模态的 mixture-of-experts 模型;每次推理激活约 490 亿参数,并把 instruction、reasoning、agentic workflow、coding、多模态理解和网络安全能力纳入同一个模型叙事。
Berman 的切入点很清楚:他不是只复述发布稿,而是把 Le Chonk 放进全球模型竞争中审视。节目覆盖欧洲主权叙事、与中国开放模型和美国闭源前沿模型的对比、API 价格、多个 benchmark、权重尚未发布时的 public preview 状态,以及他亲自用 OpenCode 做 Rubik's cube 编程测试时遇到的现实摩擦。
二、本期主要内容
节目开头,Berman 先给出一个强判断:Mistral 终于做出了一个“完全在欧洲从零烘焙出来”的前沿模型,而且不是搭在中国开源模型之上的后训练版本。这个判断奠定了整期节目的主题:Le Chonk 不只是又一次模型发布,而是欧洲在美国闭源模型和中国开放模型主导的竞争格局中重新发声的一次尝试。
随后,他解释模型的基本结构。Le Chonk 是一万亿参数的 open-weight、open-source 模型;由于采用 MoE 架构,每次回答问题时只激活一部分专家参数。节目给出的数字是 490 亿 active parameters。Berman 认为,总参数与激活参数之间的比例令人印象深刻,因为它让模型在规模、能力和推理成本之间形成了一种工程折中。这个模型还被描述为原生多模态,并将指令遵循、推理和 agentic 能力统一在同一个模型里。
接下来,节目进入现实比较。Berman 报告的 API 价格是每百万输入 token 1.36 美元、每百万输出 token 4.18 美元,并把这个价格放在 GPT 6.1 Sol、Claude Opus 5.5 等闭源模型更快、更便宜、更强的背景下讨论。他没有否认开放权重的价值,但提醒观众:今天选择开源模型,理由越来越不能只靠“便宜”或“快”,而要看控制权、隐私、自部署、零数据保留和可调整 guardrails。
基准测试构成了节目的中段主体。Berman 讲到 DeepSweep 1.1、Terminal Bench、Automation Bench、Artificial Analysis Cyber Index、CyberGym 等多个评估。他承认 Mistral Large 4 preview 相比 Mistral Medium 3.5 有明显跃升,在开放模型中进入第一梯队;但他也反复把它与 Kimi、GLM、DeepSeek 以及美国闭源前沿模型对照,避免把“有竞争力”说成“全面领先”。节目最后转向亲测:他把 API key 接进 OpenCode,让模型做 Rubik's cube simulation,结果暴露出 thinking tokens、context limit、agentic harness 适配和最终 demo 缺陷等现实问题。
三、核心观点:推理、例子与边界
Berman 的第一个核心判断是,Le Chonk 的意义首先来自“欧洲从零训练的基础模型”这一身份。他说,这个模型从构思、设计、创建、训练到 inference 都在欧洲完成;更具体地说,它是在 Mistral 自己的欧洲数据中心,用 3,800 块 Nvidia Grace Blackwell GPU 从零训练,public preview 也运行在同一套基础设施上。因此,所谓主权并不只是公司注册地或地理标签,而是训练路径、算力基础设施和服务链路共同构成的技术事实。对 Berman 来说,关键不只是市场上多了一个竞争者,而是美国和中国之外的欧洲开始拿出自己的基础模型,而不是在中国开源模型底座上继续后训练。
第二个判断是,Le Chonk 很强,但强得有边界。在 DeepSweep 1.1 中,Mistral Large 4 preview 得到 62,低于 Kimi K3 with KimiCode CLI 的 68;在 Terminal Bench 中,它再次排第二,GLM 5.3 以 40 明显领先,Kimi K3 为 22;在 Automation Bench 中,它的 59.9 接近 GLM 5.3 的 62.2,也高于 Kimi K3 的 58.3。Berman 对这些结果的解读不是简单庆祝,而是强调它从 Mistral Medium 3.5 的低位大幅跃升,进入了真正有竞争力的位置。也就是说,节目能够支持的结论是“显著进步,并进入开放模型前列”,而不是“已经全面压倒所有开放模型”。
第三个判断是,网络安全可能是 Le Chonk 最突出的单项能力。Berman 说,它不只是相对于 open-source 或 open-weight 模型表现不错,而是可以与包括闭源模型在内的强模型竞争。他引用 Artificial Analysis Cyber Index 相关说法,称 ML4 在真实软件中发现和修复安全缺陷的独立评估里进入全球前五,并领先中国之外的 open-weight 模型。在 CyberGym 图表中,Mistral Large 4 得到 82,是展示出的 open-source 模型第一,包括中国模型在内。不过,他也保留了必要限制:这张 CyberGym 图没有 Fable、Astra,也没有 OpenAI、Anthropic 的其他闭源模型,因此不能把这个 82 直接解读为全体模型第一。
第四个判断更直接:开放权重不会自动变成大众产品。Berman 尝试把 Mistral API key 接入 OpenCode,模型输出大量 thinking 或 chain-of-thought token,直到撑满 context window 后停止,而且没有给出有用反馈。他说,自己已经算是技术型用户,却仍然需要处理 API key、context window size、thinking effort 等细节;普通用户不会愿意管理这些问题。这里的推理很清楚:模型裸能力、API 可调用性和真实产品可用性不是同一件事。Claude Code、Codex、Grok、Cursor 之所以成为对照,不只是因为模型能力强,也因为用户不必手动理解和配置这些底层细节。
第五个判断是,开源模型的商业价值正在重新定位。Berman 认为,当闭源模型同时变得更强、更快、更便宜时,开源模型的卖点不能继续主要依赖“便宜”或“速度”。它的价值要转向控制权和可改造性:open-source hosting 可以带来 ownership、privacy、zero data retention,也让企业控制 guardrails、选择部署位置,并针对特定任务优化模型。相应的限制也很明确:今天真正适合开源模型的用户,往往是拥有内部技术能力、规模化调用需求和任务迁移能力的组织,而不是只想即插即用的个人。
第六个判断来自 Rubik's cube 测试:Berman 认为失败不能完全归因于模型本身。第一次运行时,他把 thinking effort 设为 high,模型一路消耗到约 32,000 tokens 后停止;在调高 context limit、关闭 thinking 后,模型生成的 cube 看起来不错,也能旋转,但 scramble 动画一开始没有真正动,后续侧面旋转能动了,颜色却消失,autosolve 最后又发生颜色重置。Berman 明确说这算失败,但他更倾向于把问题归因于 model 与 harness 的交互。这个例子说明,在 agentic coding 中,benchmark 排名不能完全预测真实工作流表现;如果模型公司或工具方没有提供适配良好的 harness,强模型也会被上下文管理、工具调用和交互协议拖累。
四、学习与应用
对团队选型来说,这期节目最实用的启发,是先把三件事分开:模型能力、部署控制权、产品体验。Le Chonk 可以是一个值得试验的开放权重前沿模型,但如果目标是让普通开发者马上稳定完成 agentic coding,Berman 的测试说明,单纯拿 API key 接进通用 harness 可能不够。更稳妥的应用方式,是先做小范围 proof-of-concept:固定任务类型,设置上下文预算,明确 thinking 配置,记录失败模式,再决定是否扩展到生产工作流。
如果组织的核心需求是隐私、数据保留、部署位置和 guardrails 控制,Le Chonk 这类模型的价值会更突出。Berman 的判断是,开源模型今天最适合有工程能力和规模化调用需求的公司:这些组织可以把部分任务从 OpenAI 或 Anthropic 迁移到一个稍弱但可控、可优化的模型上。前提是团队有能力维护推理环境、评估质量、处理上下文窗口、调试工具链,并清楚哪些任务可以接受能力差距。
如果团队主要追求最低成本或最快上手,就不能把“open source”当作自动答案。节目中,Berman 反复比较 GPT 6.1 Sol、Claude Opus 5.5 与 Mistral Large 4 preview,结论是闭源前沿模型已经在价格、速度和产品化体验上压低了开源模型的默认优势。因此,实际采购或集成时,应把单位任务成功率、人工调试时间、失败恢复成本、上下文长度、token 速度和最终可维护性一起计算,而不是只看每百万 token 标价。
在网络安全场景中,Le Chonk 值得单独关注。episode 支持的用法不是“直接相信它能替代安全团队”,而是把它作为漏洞发现、修复建议、代码审查或安全自动化实验中的候选模型。因为 Berman 同时提到 CyberGym 和 Artificial Analysis Cyber Index 的亮眼表现,也提醒某些图表缺少关键闭源模型,所以更稳妥的做法是让它在本组织代码库、真实漏洞样例和受控 red-team 环境中复测,而不是把榜单名次当成普遍事实。
对开发者工具团队而言,最明确的应用边界是 harness。Berman 的 Rubik's cube 测试说明,agentic coding 的失败可能来自模型,也可能来自模型与工具之间的接口:上下文窗口没有被正确识别,thinking tokens 失控,动画任务分解和可视化验证不稳定,都会让最终 demo 失败。因此,如果要把 Le Chonk 接入内部 coding agent,需要把模型配置、上下文管理、工具调用协议、错误恢复和视觉或单元测试验证做成一体,而不是只替换模型名称。
最后,对内容消费者或投资观察者来说,这期节目提供了一个评价开放模型发布的框架:看它是不是从零训练;看权重是否已经发布,而不只是承诺发布;看 public preview 与受信任伙伴版本是否存在不同 guardrails;看 benchmark 的参照系是开放模型、闭源模型还是特定领域模型;还要看真实用户能否顺畅使用。Le Chonk 的结论因此是积极但不浪漫的:它是欧洲 AI 生态的重要进展,也是开源竞争的好消息;但在价格、上下文、易用性和 agentic harness 上,仍有需要补齐的工程缺口。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment