企业 AI 智能体为什么卡在生产环境前:Manoj Saxena 谈运行时控制、信任态势与数字劳动力
当 AI 智能体开始访问数据库、调用工具并代表企业采取行动,难题就不再只是模型是否答对,而是谁能在行动发生前约束它。Eye on AI 主持人 Craig S. Smith 与 TrustWise 创始人兼 CEO Manoj Saxena 围绕这一生产化缺口,讨论了 AI 控制塔、守护型与 Genesis 智能体、模块化防护、语义行动层、成本与监管证据,以及这些主张目前能够说明什么、还不能证明什么。
一、嘉宾背景
Manoj Saxena 看待企业 AI 的角度,来自一段很具体的商业化经历。他在 Eye on AI 节目中介绍自己是 TrustWise 创始人兼 CEO,并称这是自己的第五家创业公司。更早之前,他参与 IBM Watson 的商业化。按他的回忆,IBM 董事会要求他把参加《Jeopardy!》的 Watson 变成可部署产品,他随后用了约三年,把一个“主卧大小”的系统缩到“一个披萨盒”大小。
这段经历解释了他在访谈中的关注点:模型演示是否惊艳并不是终点,真正难的是把系统缩成企业能够部署、批准、付费、审计并长期运行的产品。节目接近 62 分钟,标题用了“95% of AI Agent Projects Fail to Reach Production”。这个比例来自 Saxena 在对话中援引的一份 MIT 报告,也是节目用来组织讨论的框架;它不应被读成覆盖所有行业、时期和智能体项目的独立普遍测量。
Saxena 说,ChatGPT 发布后,行业迅速追逐更大、更聪明的模型,他却觉得保护结构没有同步出现。他把模型比作不断增大的核反应堆核心,把企业缺少的控制层比作覆盖其上的穹顶。TrustWise 正是从这个问题出发,把 Harmony AI 定位为面向生成式 AI 和智能体系统的“AI 控制塔”,而不是另一个基础模型或应用界面。
二、本期主要内容
访谈从“信任”到底指什么谈起。Saxena 认为,问题已经不只是模型输出是否准确,而是 AI 会不会按照用户和企业的意图行事。他给出三项变化:AI 正从生成邮件、图片和回答,转向代表人采取行动;企业架构正从单模型流程走向多智能体、多模型协作;政策也不能只在部署前写好,而要在系统运行时持续约束每一次工具调用、行动和输出。
因此,他反复把智能体称为“数字劳动力”。一个任务可能持续数分钟、数小时,甚至数天。企业若要引入成千上万的数字员工,就需要某种类似人力资源和财务部门的基础设施:让智能体入职,分配行为手册,评估表现,管理预算,设置停止开关,并留下审计证据。这里的治理不是一份上线前签字的文件,而是一套伴随数字员工持续运行的管理系统。
TrustWise 用两类智能体说明这套控制塔的分工。守护型智能体(guardian agents)负责智能体的接入、监督、对齐和行为控制。Saxena 强调其中要有人参与,也要追求确定性结果,因为企业不可能靠人工逐个接入和测试庞大的智能体群。Genesis 智能体则面向更高价值的探索任务;访谈后段把它展开为发现“未知的未知”、生成假设的系统。Saxena 明确表示,公司当前的主要精力仍放在守护型智能体上。
模块化 AI 防护(AI shields)不是独立智能体,而是装在守护型智能体上的能力包。Saxena 将它们分为安全与防护、合规与监管、成本与碳管理三组,并把这三组能力合称“信任态势管理”。这也是 TrustWise 对自身类别的定义:它不想只做安全、治理或可观测性中的一块,而是试图在行动发生时同时权衡安全、合规、效率和证据。
产品形态也围绕这个定位展开。Saxena 说,TrustWise 的核心是一组 API 和 CLI,而不是再增加一个仪表盘;同时,公司提供一个供人使用的参考界面。人在其中主要完成四类工作:接入智能体;用类似模拟器的方式评估不同任务和行动路径;上线后监测偏移;为审计和学习生成可证明的证据。底层的语义行动层(semantic action layer)被他描述为一张带时间序列的语义图,记录模型、数据、政策、约束和上下文,既用于驱动智能体行为,也用于回放和解释已经发生的行为,还能生成表格、报告并回答自然语言问题。
谁来负责这套系统,同样是访谈重点。Saxena 说,智能体风险已经进入董事会和 CEO 的议程。生产化决策通常牵涉 CIO、AI 负责人、负责任 AI、风险、合规、安全和财务团队;日常运行又分布在业务与 IT、风险与合规、内部审计几道防线之间。他援引 MIT 报告称,95% 的智能体项目没有从试点走入生产环境,并把瓶颈归因于这些职能缺乏足够信心,而不是智能体本身难以搭建。这个解释属于他的判断,但它点出了访谈的主线:企业卡住的往往是批准和持续控制,而不是演示。
TrustWise 先从银行和保险切入,随后扩展到医疗、零售和消费品。Saxena 举例说,Yum Brands 正在研究如何为 Pizza Hut、KFC 和 Taco Bell 的语音点餐智能体提供运行时控制;他还称 Hitachi 是投资方,并正在考虑把 TrustWise 作为 OEM 控制层,用于其 650 个业务单元。这里应保留原话的范围:这是 Saxena 对客户探索和合作方向的描述,不等于访谈提供了已经全面落地的外部验证。
技术接入上,控制塔位于智能体编排层之上、用户体验层之下,通过网关、探针或代理连接,可按实时、伴随、批处理或上线前模拟四种模式运行。Saxena 称它不绑定某种智能体、框架、云或模型,并提到 Azure、AWS、GCP,以及与 Nvidia 合作的 Dell 本地部署环境;在智能体来源上,他列举了 LangGraph、ServiceNow、Microsoft Copilot 和 Claude。产品早期名为 Optimize AI,主要面向生成式 AI;当前版本称为 Harmony AI,用来强调多个供应商的多个智能体需要协同运行,而产品类别仍是 AI 控制塔。
三、核心观点:推理、例子与边界
Saxena 最有解释力的一句话是:“AI 不是应用,而是行动者。”传统企业软件等待输入,按相对固定的规则执行;智能体却可能登录网站、访问数据库、调用工具,并随着数据、模式和上下文变化,在明天采取与今天不同的行动。治理对象因此从“应用是否合规”变成“行动者可以走哪条路径”。他据此描述了一套新的企业 AI 技术栈:底部是算力和数据,其上是模型与智能体编排,再上面是运行时控制,最上层才是用户体验或机器体验。
运行时治理与声明式治理的差别,就在决策发生的时刻。Saxena 所说的运行时控制,不是几周前写进政策文件,也不是几小时后才出现在审计日志,而是在行动发生前给出判断。英国 FCA Consumer Duty 的例子把这一点说得很清楚:一名 85 岁、刚失去配偶且陷入财务困难的贷款申请人,与一名 24 岁、刚找到工作的申请人,可能需要不同的语气、清晰度、帮助程度、批准、拒绝或升级路径。系统要在继续执行前判断客户是否处于困境、行动和语气是否允许、是否需要人工批准,以及不确定时应拒绝还是交给人处理。
他对现有企业工具的批评也围绕这个时间点展开:安全产品大多从外向内防御,难以处理智能体成为内部行为风险;治理工具可以定义政策,却未必能在运行时引导行为;可观测性告诉企业发生了什么,却不负责改变行为。这个论证并不适用于所有 AI 系统。只做低风险文案辅助的工具未必需要完整控制塔;一旦系统拥有权限、能够连续调用工具,并影响银行、保险、医疗、理赔或语音点餐等真实业务结果,事后日志就很难代替行动前控制。
TrustWise 进一步把自己放在“跨供应商元控制面”的位置。Saxena 的理由是,大企业很少只用一个模型、一朵云、一种编排框架或一家智能体供应商。每个平台即使都有自己的控制面,企业仍需要一层横跨全局的控制和证据。这个判断符合多云、多模型采购的现实,但访谈给出的仍是公司描述、客户例子和部署主张,并没有提供独立的跨平台可靠性对比。
Saxena 还给出了一组运行时技术数字。他称系统使用 12 个小型、高精度、低延迟模型,以及 15 个他所谓的“scales and orchestrators”;根据工作负载不同,评估和引导可能从约 300 毫秒到 10 秒。这些数字说明公司希望用专门的小模型和编排机制做实时控制,但访谈没有披露测试方法、工作负载分布或误差,因此不能据此判断它在不同企业环境中的实际性能。
成本在这套叙事里不是采购部门的附属指标,而是信任的一部分。Saxena 说,一次输入可能触发 20 到 50 个行动,消耗的 token 可达到两年前生成式 AI 系统的 20 到 40 倍。他还称 TrustWise 的案例曾做到最高 83% 的成本降低,同时安全提升 40%、延迟降低 60%。后面这组百分比是公司案例主张,不是独立建立的行业基准;更可靠的推论是,智能体一旦开始循环、检索、重试、调用其他系统或彼此协作,成本、延迟和安全就会变成必须共同优化的运行时变量。
公司对监管能力的描述同样具体,也同样需要归因。Saxena 称 TrustWise 提供覆盖 17 个监管与风险框架的 1100 多项控制,包括 NIST AI RMF、EU AI Act、OWASP、HIPAA、SR 11-7 和 UK FCA Consumer Duty;策略库每 30 天更新一次,客户和合作伙伴也可以创建自己的政策。这说明其产品主张不只是记录日志,而是把监管要求转成可执行的运行时政策。访谈本身没有逐项验证这些控制的完整性、更新质量或监管认可程度。
语义行动层是这套架构中最关键、也最难从访谈外部验证的部分。Saxena 认为,知识图谱描述关系,上下文图补充情境,世界模型总结更一般的规律,但这些都不足以约束智能体在某一刻可以采取什么行动。TrustWise 的语义行动层据称会预先定义允许的行动路径和权限路径,并把它们映射到对齐框架。自动驾驶类比很直观:与其每走一小段就重新计算整张地图,不如先有一张可行路径图,再快速判断下一步是否允许。不过 Saxena 也明确把实现称为核心知识产权,所以对外能够确认的是概念和目标,而不是技术充分性。
这套对齐框架包含六层:全球权利、国家法律、行业规则、公司价值观、业务单元与工作负载上下文,以及客户 SLA 或互动要求。Saxena 认为,一次提示不足以约束会自行设定实验、行动并复盘数小时乃至数天的自治循环,因此 prompting 的地位会下降,持续对齐更重要。他同时承认,基础模型吸收的是一幅不完整、而且很大程度偏西方的人类价值快照;企业目前更现实的起点,是先把公司价值观写进智能体行为。运行时控制由此不再只是工程问题,也包含组织选择、地区差异和责任授权。
访谈把这一趋势延伸到“智能体体验”(AX)。Saxena 预测,三年内 AI 控制塔的使用者中会有 90% 是智能体而不是人。Craig S. Smith 提到药物发现材料可能从“AI 写给人看,再由另一套 AI 阅读”,转向系统直接交换结构化数据;Saxena 将其连接到跨企业、多智能体工作流。这是一个方向判断,而不是已完成的现实。监管、责任、审计格式和组织信任,都会决定自然语言中间层能否被移除。
Genesis 智能体把控制之外的另一面暴露出来。Saxena 将它描述为假设生成系统,用于收入流失、欺诈等领域寻找“未知的未知”。他甚至认为,幻觉经过控制和验证后既可能是缺陷,也可能成为发现工具;但他随即给出边界:“十个里也许只有两个是对的。”这使 Genesis 智能体更适合探索和分析增强,而不是自动裁决或直接执行。更进一步,他认为垂直 AGI 或自主财务离不开企业自己的上下文、数据和政策,因此基础模型提供商无法单独解决企业对齐问题。
Saxena 把这个新类别称为“cyber trust”,而不是传统 cybersecurity,并转述估算称市场当年约 20 亿美元、到 2030 年可能达到 800 亿美元。他预计治理、安全和可观测性厂商都会进入。与 95%、成本改善和三年内 90% 的预测一样,这些市场数字应放在“演讲者援引的估算和公司判断”一栏,而不是当作已经核实的市场事实。
四、学习与应用
企业评审智能体项目时,最先要问的不是“演示能不能跑”,而是“它可以被允许做什么”。只辅助起草文本的系统,控制负担可以较轻;能够登录网站、访问数据库、调用工具、影响客户处理或代表企业持续行动的系统,则需要在设计阶段写清允许路径、禁止路径、人工批准点、拒绝条件和升级条件。Saxena 所说的数字劳动力,真正对应的是一套岗位、权限、政策和责任设计。
这套设计可以直接变成生产准备清单:每个智能体的任务边界是什么,依据哪本政策手册,谁批准上线,如何在生产前模拟,哪些偏移信号需要监测,何时触发停止开关,出现异常成本、越权调用或证据缺失时由谁接管。审计团队还要能在多年后重建一次关键行动:当时用了哪些模型、数据、政策和上下文,调用过什么工具,在哪一步交给人,最终产生了什么结果。TrustWise 的参考界面和语义行动层,正是围绕接入、评估、偏移监测和证据回放这四类工作来设计的。
企业还需要同时管理三种 AI 表面:自己建设的 AI、从供应商购买的 AI,以及可能被外部 AI 利用或攻击的既有主机、聊天机器人、数据库和模型。Saxena 将其概括为 build、buy、protect。实践上,这意味着风险清单不能只覆盖内部开发团队,也要覆盖 SaaS 智能体、外购功能和原有资产暴露面;董事会、CIO、AI 负责人、风险、合规、安全、财务、业务与内部审计也不能各看各的日志。
接入方式要服从风险和时效,而不是一律要求最重的实时拦截。控制塔可以实时介入,也可以伴随观察、定期批处理,或只在上线前做模拟。企业应按行动后果、监管要求和可接受延迟选择模式。跨供应商环境里,比“立刻统一所有模型”更迫切的通常是统一证据:谁触发任务,智能体访问了什么,调用了哪些工具,受哪些政策约束,何时发生人工介入,最后形成什么业务动作。即使不采用 TrustWise,这条证据链仍然要有人建设。
成本治理也不应等到上线后看账单。按 Saxena 的流程,系统先用 Responsible AI Institute 的 TrustX 框架分类,再在生产前模拟并调整分块大小、分块数量、模型和端点,上线后继续监测偏移、控制过严和 token 浪费。企业可以据此建立自己的闭环:先按风险与任务类型分类,再用真实失败路径和工具调用链做压力测试,最后把成本、延迟、政策偏离、人工升级和业务结果放在同一张运营视图中。这样才能避免两端同时失控:控制太少,风险团队不批准;控制太多,智能体又慢、又贵、失去用途。
人力成本比较也要更细。Saxena 预计,某些智能体每年的运行费用可能等于甚至高于一名员工。他给出的改善方向包括划分不同“工种”、动态选择和路由模型、用分析找出浪费点,以及未来让智能体自行调整所用模型;他同时承认,最后一种能力还没有成熟。企业因此不该用一个平均 token 单价估算所有智能体,而应按任务复杂度、自治时长、工具调用次数、模型组合和人工复核成本分别核算。
守护型与 Genesis 型能力也应放在不同制度里。前者可以进入生产门禁,负责权限、政策、成本、语气、审批和审计;后者更适合收入流失排查、欺诈线索和财务分析等假设生成任务,输出先进入验证流程,不能直接触发高后果行动。“有益幻觉”只有在证据复核、因果验证、合规审查和业务责任人批准都存在时,才可能带来价值。
访谈中的 95% 不是企业可以直接拿来写商业计划的基准。更有用的做法,是回到自己的系统测量:试点进入生产环境的比例是多少;一个任务实际触发多少次行动;token 成本在哪种循环中失控;运行时政策增加了多少延迟;统一证据是否真的减少人工复核和审计负担。只有这些内部答案稳定下来,AI 控制塔才不再只是一个产品类别,而会成为可检验的生产基础设施。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment