生成式 AI 正在降低企业级 Agent 的原型门槛。一名有经验的工程师,借助通用大模型和一段简单 Prompt,往往一天就能搭出一个看起来“挺好用”的 Demo。但越来越多团队发现,真正困难的部分并不在这里。从 0 到 80%,模型已经完成了最重的工作;而从 80% 到 95% 甚至 99%,权限、状态、审计、错误恢复、数据接入、可观测性和生产治理等问题,才是企业级 Agent 项目真正要跨过的门槛。
Demo 容易,是因为它只走“最常见路径”
素材指出,AI Demo 之所以好做,是因为它通常只覆盖最常见的路径。原型阶段的测试用例往往由开发者自己挑选,自然会偏向那些能够顺利跑通的场景。一旦进入生产系统,情况会完全不同。生产环境要面对的是长尾问题、异常输入、合规要求和责任边界,而这些内容在 Demo 阶段很难出现。
这意味着,企业级 Agent 并不是“把模型接上就能用”。当用户提出 Demo 中不存在的问题,或者行业术语理解出现偏差,整个对话链路都可能偏离预期。此时,团队要做的不再只是调用模型,而是补充 Prompt、增加规则、构建测试集、进行数据标注。这些工作看起来不够“AI”,却决定了系统能否进入真实业务环境。
从 80% 到 99%,难点在于概率系统的不可完全测试性
与传统软件不同,AI Agent 的输出并不具备完全确定性。传统测试通常是“确定性输入配确定性输出”,跑通之后结果基本稳定;但大模型本质上是一个概率系统,输出空间开放,永远存在不可预见的边缘案例。
这给测试和修复带来了新的复杂度。修复一个问题,可能会影响另一个场景的概率分布,导致原本稳定的地方出现波动。素材中提到,“改好 A 又坏 B”并非工程能力不足,而是这类系统本身的性质决定的。
更关键的是,哪怕只有 1% 的错误,也可能在高风险场景中造成严重后果。客服答错一次,可能成为品牌事故;金融、医疗、政务等场景中的一次误判,则可能触发合规风险。随着系统接入的业务越来越多,权限管理、审计记录、回滚机制、人工接管等能力都会叠加进来,其复杂度不是线性增长,而是乘法增长。
企业真正付费的,是 Demo 到生产之间的那条沟
素材提到,FDE 所做的工作并不是从 0 到 80%,而是从 80% 到 99%。客户愿意为这一阶段付费,并不是因为他们看不到 Demo,也不是因为他们自己搭不出原型,而是因为从 Demo 到生产之间存在一条很长的沟。这条沟里装的是长尾场景、合规要求和责任边界,而 Demo 本身并不会提前告诉团队它有多深。
从工程经济学角度看,99% 往往是一个更现实的目标。将系统从 99% 推向 99.9%,边际成本会快速上升,边际收益却开始递减。对于高风险场景,最后那 1% 本来就不应完全交给 AI 自动处理,而需要通过人工审核和回滚机制兜底。换言之,成熟的 Agent 系统并不是追求全自动,而是让 AI 覆盖可规模化的部分,让人工守住不可自动化的部分。
为什么很多企业还在试点阶段不动了
素材中还提到一个看似矛盾的现象:超过 70% 的企业已经在至少一个职能中尝试生成式 AI,但超过 60% 仍停留在试点或实验阶段。模型能力持续提升,企业却并没有同步快速推进。
原因并不在模型本身。真正卡住企业的,是最后那 20% 的生产化工程。模型每一次升级,拉大的不是“技术能做到”和“做不到”的距离,而是“技术能做到”和“组织用得起来”的距离。企业引入 AI 通常要经历三个阶段:个人提效、组织转型、业务重构。每个阶段都可能需要以年为单位的投入。Demo 跑通只是第一阶段,而后两个阶段与模型是否先进并不直接相关。
因此,Demo 的价值并不在于直接替代生产系统,而在于提前暴露风险。一个健康的工程模式,不是把 Demo 当作终点,而是把它作为进入生产验证和经验积累的起点。一天搭出 80% 的 Agent 是正常发挥,卡在 95% 甚至更久,同样不罕见。真正决定项目能否落地的,是团队是否意识到:最后那段路,本来就是最难走的部分。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/yi-tian-da-wan-80-de-agent-hou-wei-shen-me-hen-duo-tuan-dui