多智能体不是越多越好:一项研究发现任务拆分存在信息产出守恒边界

多智能体架构常被用于提升复杂任务效率,但一项基于生产数据的研究显示,任务拆分带来的信息产出并非线性增长,层级增加还会造成确定性损耗。

AI Agent 工程实践中,多智能体架构常被寄望于通过任务拆分提升复杂问题的解决能力。但一篇发布于 2026 年 9 月 15 日的 arXiv 论文提出了一个更基础的问题:当任务被层层分解给多个子智能体后,最终有多少信息能够真正回传至根节点?

该研究给出的答案并不乐观。在特定条件下,无论任务被拆成多少层、多少分支,最终可回传的发现数量可能保持恒定;而在基于生产环境数据的估算中,研究类任务的信息产出随规模增长呈现次线性特征——来源数量增加 4 倍,最终报告内容仅增加约 2.3 倍。

拆分改善的是执行条件,而非信息总量

业内通常为多智能体系统给出三条理由:上下文更小、关注点分离更清晰、任务可并行。Anthropic 曾公开其多智能体研究系统的数据:由 Opus 担任 lead、Sonnet 担任 worker,在广度优先的研究类查询上比单 Agent 的 Opus 胜出 90.2%;并行化最多可将复杂任务研究时间缩短 90%,但 token 用量约为单一聊天交互的 15 倍。其材料还提到,token 用量本身解释了 80% 的性能方差。

这些指标说明拆分对 Agent 运行有利,但论文进一步追问:拆分对“找到的东西”是否同样有利?以 deep research 场景为例,一个主 Agent 派出 8 个子 Agent 查资料,每个子 Agent 读取 50 个来源并提交摘要。理论上共有 400 个来源,但最终报告中能保留多少信息,取决于 Agent 在处理条目时的保留概率,而非架构本身。

论文引入一个简化假设:当 Agent 接收 b 个条目时,它将任意一个条目保留并上传的概率为 r(b)。如果 r(b)=1/b,则每个节点期望保留 1 个条目。在此条件下,无论树形结构如何变化,最终交付给根节点的发现数量恒定为 1。作者在 20,000 棵随机不规则树上验证,误差为 2.4×10⁻¹⁵,接近浮点精度极限。

这意味着,在该参数设定下,“拆分带来更多覆盖”和“层级造成信息漏损”恰好相互抵消。改变架构只是改变信息从哪条路径流失,并未改变总流失量。

生产数据测出的衰减指数:来源翻 4 倍,产出约 2.3 倍

论文进一步将保留概率推广为 r(b)=C·b^(-δ),其中 δ 描述 Agent 面对更多条目时的信息衰减特征,C 则对应 Agent 面对单一条目时的保留概率。对于深度为 k、总覆盖 N 个发现的树形结构,最终产出可表示为 C^k · N^(1-δ)。

这个公式将影响因素分为两类:架构项 C^k 与任务项 N^(1-δ)。由于 C 不大于 1,每增加一层都会带来确定性损失;而 δ 更多由 Agent 与任务决定,调整架构图无法改变这一指数。

基于 600 条生产环境 deep-research 轨迹,作者使用三种互不共享失效模式的识别方法交叉估算,得到 δ=0.34,95% 置信区间为 [0.30, 0.38]。代入后得到 N^0.66 的产出关系:当叶子节点覆盖来源增加 4 倍时,最终内容只增加约 2.3 倍。若希望最终信息量翻倍,叶子节点工作量需提升至约 2.86 倍,接近 3 倍。

在 C 的测量上,作者选择“搜索工具返回 b 个编号结果,Agent 写一轮输出”这一环节,因为条目边界由工具返回结果客观划定。测得 C=0.571,95% 置信区间为 [0.527, 0.615]。也就是说,每增加一层,产出约乘以 0.571,两层后约剩 0.326,三层后约剩 0.186。

此外,论文还统计了子 Agent 理解偏差。在 1,012 条标注过的多智能体轨迹中,每 16 份 brief 有 1 份偏离目标,对应 μ=0.939。综合保留率与偏离率后,每层实际产出系数为 0.571×0.939=0.536。换言之,每增加一层,产出大约打 5.4 折;两层约剩 0.287,三层约剩 0.154。

分层的价值不在产出上限,而在根节点上下文与成本曲线

如果分层会确定性压缩信息产出,为何多智能体系统仍能表现出优势?论文给出的解释是:产出并非唯一目标。分层的另一个收益在于保护根节点上下文。

子 Agent 的上下文在任务结束后可以释放,但根节点上下文贯穿整个任务,且没有更上层可以压缩它。随着深度增加,根节点直接面对的条目数从 N 降至 N^(1/k)。在 N=1000 的情况下,单层需要面对 1000 个条目;两层约为 32;三层约为 10。

这与上下文衰减现象相关。一旦上下文进入较长区间,模型对中间内容的利用能力可能下降,而根节点上下文是唯一从任务开始持续积累到结束的部分。因此,“上下文更小”的真正价值并非保护子节点,而是保护最终负责汇总和输出的根节点。

成本方面,论文测得生产环境 flat Agent 的费用按 N^1.39 增长,而非朴素 append-only 假设下的 N²。这说明真实系统已存在前缀缓存、压缩等优化手段。结合产出损失与成本收益,论文给出闭式最优层数,并指出任务规模上升 14 个数量级时,最优层数只增加 7 层。也就是说,架构选择对任务规模变化并不敏感。

论文还给出一个具体判据:在等花费条件下,两层结构在 N=403 个发现处超过 flat。少于 403 个发现时,单 Agent 更划算。

委托不是上下文溢出后的应急动作

该研究另一项具有工程价值的发现来自对真实委托行为的分析。作者使用 743,819 次生产工具调用数据构建离散时间 hazard model,并且仅使用决策前信息,以避免决策后状态影响回归结果。

结果显示,上下文每翻一倍,委托发生的 odds ratio 为 0.969,95% 置信区间为 [0.954, 0.985]。置信区间完全低于 1,说明上下文变大并未提高委托概率,反而略有下降。

这意味着,在实际系统中,委托更接近一种开局动作,而不是上下文压力触发的应急反应。Agent 往往在任务早期就决定是否分派子任务,而非等到上下文接近上限时才拆分。如果系统采用“上下文超过阈值自动派生子 Agent”的机制,这类逻辑可能并非现实中主要的分派驱动方式。

作者同时指出,如果使用两个更朴素的回归版本,同一问题可能得到 +0.65 和 −0.37 两种相反结果。这提醒工程团队,在分析生产日志时,需要区分变量是在决策前还是决策后被观测到。

对多智能体工程落地的三点提示

论文也明确了适用边界。其 600 条生产轨迹均来自 deep research 类任务。如果工作负载是代码修改、数据清洗或客服工单,δ 可能明显不同。r(b)=C·b^(-δ) 假设保留概率只依赖条目数量,不依赖条目之间内容关系,而现实任务中条目可能冗余、互补或相互独立,这会影响模型适配度。

此外,C 的测量依赖“工具返回编号列表”这种客观条目边界,其他基于文本切分的环节未必适用同一数值。作者也说明,虽然使用三种识别方法降低口径偏差,但三种方法仍基于同一批语料,可能共享语料层面的偏差。

对于准备应用多智能体架构的团队,论文给出的方法路径较为直接:

  • 测 C:在“工具返回编号列表,Agent 写一轮输出”的环节,统计 Agent 对单一条目的保留率。
  • 测 δ:固定架构,让任务覆盖范围成倍变化,观察最终产出,对 log(yield) 与 log(N) 回归,斜率对应 1-δ。
  • 测 μ:抽样标注子 Agent 收到的 brief 与其实际执行结果,统计偏离率。

在决策层面,论文给出较清晰的参考:当 N 小于约 50 时,适合 flat 单 Agent;N 约在 50 至 400 之间,需要重点判断根节点上下文是否可承受;N 超过约 400 时,可考虑 2 至 3 层结构,但继续加层的收益有限,每层产出约乘以 0.536。

该研究并未否定多智能体系统,而是将其收益从“提高信息产出上限”转向另外几个更具体的工程目标:降低根节点上下文压力、优化成本曲线、在特定任务规模下取得更优性价比。对于 AI 应用团队而言,更关键的指标可能不是子 Agent 完成了多少任务,而是子 Agent 产生的发现最终有多少进入了交付结果。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/duo-zhi-neng-ti-bu-shi-yue-duo-yue-hao-yi-xiang-yan-jiu-fa

Like (0)
点点的头像点点
Previous 3小时前
Next 1小时前

相关推荐