沃创沃创
洞察

能挺过实际部署考验的企业AI趋势

如今大多数企业AI预算,仍然是靠一段90秒的演示来敲定的。一句干净利落的提示词输入进去,一个精美的答案输出出来,然后就有人称之为“变革”。可接下来,这套系统就要面对权限管理、糟糕的源数据、责任归属、采购流程,以及那位根本无意改变自己工作方式的员工。

这道鸿沟,正是理解真正重要的企业AI趋势的关键。这个市场从不缺模型、副驾驶(copilot)或各种宣称。它缺的,是能够在真实运营环境中赢得反复使用的系统。对创始人和资本配置者而言,这种区分绝非纸上谈兵——它决定了一款产品最终会成为受信赖的基础设施,还是在下一轮预算审查中被砍掉的一笔昂贵开支。

真正重要的企业AI趋势,是运营层面的

真正有意义的转变,不是从一家模型供应商换到另一家,而是从泛泛的能力展示转向可问责的工作流表现。企业购买的不是抽象商品意义上的“智能”,它们购买的是更快的理赔处理、更精准的风险审查、更短的销售周期、更少的客服升级,以及在决策失误代价高昂之处做出更好的决策。

这听起来是常识,但常常被忽视,因为宽泛的能力演示远比狭窄的工作流纪律更好卖。“我们的智能体能帮到每一位知识工作者”,听起来比“我们的系统缩短了合同审查周期,同时保留了可审计性”更宏大——但后者往往才是更好的生意。

能够长期占据领先地位的公司,将越来越多是那些真正掌控某个具体工作环节、对接了必要的记录系统、并且能够展示部署后实际发生了什么变化的公司。它们的优势不会来自“拥有某个模型的接入权”——因为所有人都有。它们的优势将来自流程设计、评估体系、分销能力,以及在产品足够可靠之前愿意主动为其设限的克制。

智能体正在变成系统问题,而不是聊天问题

智能体式AI(Agentic AI)是真实存在的。同样真实存在的,是“智能体完成一项预设任务”与“智能体在杂乱的企业环境中安全运作”之间的巨大差距。

一个能够检索信息、选择工具、执行工作流并将异常情况移交处理的智能体,可以创造实质性价值。但每一个额外的动作,都会引入新的失败模式:过期的权限、错误的工具选择、不完整的状态、无法追溯的决策,以及意料之外的下游影响。如果财务团队要花一整个下午去撤销它做的事,那么“自主”就算不上什么优点。

企业场景中的模式,将会是“有边界的自主性”。高频、低风险的任务可以在极少监督下运行;风险更高的工作则需要审批环节、置信度阈值、清晰的升级路径,以及一位胜任的操作者能够查阅的日志。真正该问的问题不是智能体是否能够行动,而是它可以在哪些范围内行动,才不会制造出一个比它本要解决的问题更大的管控难题。

创始人应当把人工审核视为产品架构的一部分,而不是一个令人尴尬的临时补丁。在许多工作流中,交接环节本身就是产品。让审核变得快速、清晰、有用的公司,往往会胜过那些承诺“彻底消除审核”的公司。

评估正在被纳入采购流程

下一个真正重要的企业AI趋势,没那么光鲜,却更有价值:买家已经对模糊的准确率宣称感到厌倦。他们想要的是——用他们自己的数据、在他们自己的约束条件下、针对那些正被替代或改进的实际工作,拿出真凭实据。

这改变了可信产品的构建方式和销售方式。一个通用基准测试,或许能证明某个模型具备能力,但无法证明某个产品在受监管的核保工作流、内部安全流程,或面向客户的支持运营中足够可靠。评估必须体现具体任务、错误的代价、边缘情况,以及系统应当在何种条件下选择弃权不答。

一套真正的评估体系,应当包含具有代表性的输入样本、明确的质量标准、失败情况分类、发布后的持续监控,以及一位能够在客户发现问题之前就说清楚性能为何下滑的责任人。这不是官僚主义,而是企业信任之下的证据层。

当一家公司宣称自己表现卓越,却说不清结果是如何测量出来的时候,投资者理应心存警惕。要问清楚:测试集里包含什么,多久刷新一次,哪些失败情形最为关键,以及当置信度偏低时系统会怎么做。如果得到的答案,只是“这个模型非常好”的一个包装版本,那就没有任何尽调意义上的证据,有的只是披着品牌外衣的乐观情绪。

数据权限与集成深度将拉开产品之间的差距

模型的接入正变得越来越容易获得。真正稀缺的,是干净、有权限保障、真正有用的企业上下文数据。

当一款产品能够贯通客户运营现实所依托的各个系统——文档、工单、交易记录、产品数据、政策规定和机构知识——它就变得实质性地难以被替代。但集成深度不仅仅是一道护城河,它同样也是销售周期被拉长、安全审查愈发严格、实施承诺经受考验的地方。

许多公司低估了这一点,因为它们最早的用户往往乐于上传一份电子表格,或连接一个轻量级的工作空间。但企业级买家可能会要求身份管理、基于角色的访问控制、审计日志、数据驻留承诺、数据留存管控,以及一个关于“客户数据是否会被用来改进任何共享系统”的明确答案。这些都算不上什么激动人心的演示环节,但每一项都足以让一笔交易泡汤。

更稳妥的策略,是精确界定产生价值所需的最小集成范围。有些产品需要深度写入权限,就应当据此定价、实施和治理;另一些产品则可以先通过只读访问或一个封闭的工作流来证明价值,然后再要求客户开放更多的环境权限。假装每一次实施都毫无摩擦,只会让公司赢下试点,却输掉整个客户。

市场正在重新为AI经济性定价

企业买家终于开始问一个本该早就被问到的问题:这套系统在规模化之后,成本究竟是多少?

推理成本、检索成本、人工审核、实施投入、客户成功服务、安全合规要求,以及模型本身的不稳定性,都会影响单位经济效益。一款产品在低使用量时可能看起来极具吸引力,一旦被大规模采用之后却可能在经济上变得不合理。反过来同样成立:一套具有相当可观初始投入成本的系统,如果能够消除重复性的人力劳动,或实质性地改善营收表现,也可能极具吸引力。

这正是为什么与工作流价值挂钩的定价方式,正在逐渐超越那种千篇一律、按坐席收费的AI溢价模式。按坐席定价容易解释,但往往脱离了实际创造的价值;按用量定价能更好地贴合价值,但可能让预算编制变得困难;按结果定价在结果可清晰衡量的场景下很有吸引力,但一旦结果依赖于供应商无法掌控的变量,它就会变成一个陷阱。

并不存在一种放之四海而皆准的定价模式,但确实存在一个普遍适用的要求:创始人必须在客户逼迫其正面回应之前,就搞清楚自己的经济模型是什么。毛利率不能是一个隐藏在模型成本预测背后的未来愿景——它是一项设计约束条件。

治理正在成为一项产品功能

太多团队仍把治理当作安全审查环节里的一份检查清单来对待。这个顺序其实是反的。对企业级AI而言,治理越来越决定了这款产品能否被用在真正重要的工作流之中。

买家需要知道:哪些数据进入了系统,谁能够访问输出结果,各项操作是如何被记录的,模型在哪些地方可能出错,以及当系统“不知道”的时候,这款产品会如何应对。这些答案理应清晰地呈现在产品体验当中,而不是被埋在一份在销售团队做出承诺之后才临时拼凑出来的合规文件里。

治理并不意味着要把每一款产品都变成一个内部政策门户。它意味着赋予操作者与真实风险相匹配的控制权。一个处理公开营销文案的工作流,所需要的防护栏,与一个涉及财务审批或敏感客户记录的工作流截然不同。那些把这些区别一概而论的公司,要么会过度构建摩擦环节,要么会构建不足以支撑信任——两者的代价都很高昂。

创始人和投资者应当停止奖励哪些做法

这个市场目前仍在奖励那些容易复述、却难以核实的宣称。这种状况将持续下去,直到买家和投资者改变他们提出的问题为止。

不要再奖励那种没有清晰的第一个落地工作流、却大谈平台愿景的宽泛言辞。当转化率、扩展使用和活跃使用数据都缺失的时候,不要再把试点数量当作产品市场契合度的证据。不要再把一张庞大的模型账单误认为是护城河。不要再把一份安全路线图当作已经具备的安全能力。也不要再纵容一个团队把自己的产品描述为“全自动”,而其每一个有意义的结果,实际上都依赖于隐藏在幕后的人工操作。

以上这些,都不是在主张要从AI领域后退。恰恰相反,这是在主张:应当用成年人的标准,去要求这样一个长期被允许混淆“技术上可行”与“商业上成熟”这两件事的领域。

真正值得投资的公司,会做出一个更为具体、克制的承诺,在苛刻的环境中证明它,然后依据证据、而非雄心去扩张。这样的路径,在路演会议上或许不那么激动人心;但当续约合同真正落地的那一刻,它会激动人心得多。

您的领导方式在哪里有效,又在哪里正在消耗公司?

这个博客讨论的多数问题,最终都回到创始人如何经营公司这一点上。藤架领导力诊断把它拆成六个维度共24道行为锚定题:约12分钟,即时出结果,自助版免费。

开始藤架领导力诊断 →

想了解兼职高管或顾问合作?预约探索性通话 →

Book a Call