一、调研困境:信息越多,结论越模糊
无论是人类还是AI,在开展技术调研时都容易陷入“信息过载”的陷阱。随着信息量的激增,观点逐渐多元,结论反而变得模糊不清。因此,回归核心目标是调研的第一要务。
过去,AI在注意力与联想能力上存在明显短板:它容易受限于当前信息量,难以实现真正有价值的跨领域联想。然而,AI的执行力恰恰是其优势所在——它能够以Agent形态层层推进,完成信息的搜集、归纳与总结,避免细节上的损耗。
尽管我已有自己的深度研究系统,但当Claude Code推出Dynamic Workflows(动态工作流)功能时,我决定与其进行一次“对决”——看看默认的官方能力能否全面超越个人定制的方案。
二、Dynamic Workflows的核心机制
Dynamic Workflows的创新之处在于:在执行任务前,先由AI自动设计最佳工作流,随后启动执行。这与传统的“计划模式”或Skill有本质区别:
- 计划模式:仅将任务拆解得更细,但未必符合合理的工作流逻辑。
- Dynamic Workflows:自动集成验收逻辑、结果收敛与对抗验证等关键环节。
触发方式极为简便:在Claude Code中使用/deep-research命令,提供调研模板和入口资料即可。若需单独调用动态工作流能力,直接使用提示词或输入ultracode即可。需注意,Token消耗约为常规模式的数十倍。
三、六大工作流模式详解
动态工作流底层整合了六种核心调度模式,其本质围绕两个核心问题展开:任务如何拆解?结果如何整合?
3.1 路由模式(Classify-And-Act)
该模式由一个Agent负责识别任务类型,随后将任务分配给最合适的专业Agent执行。核心在于路由的选择逻辑——一个任务仅走一条路径,其他路径完全不执行。
实际应用:可预设三个子Agent角色——严格验证数据的分析Agent、擅长写作的输出Agent、专门寻找漏洞的挑战Agent。路由层判断子任务适合交给谁,而非由单一Agent全权负责。
- 优势:精准高效,每个Agent的提示词高度独立,形成垂直深度探索。Token消耗最低,响应速度最快。
- 劣势:对边界模糊的任务(如“既是技术问题又是账户问题”)处理能力较弱。
3.2 拆分合并模式(Fan-out & Merge)
这也是最常用的模式之一,核心逻辑为并行+合并。任务被拆解为N个独立子任务同时运行,待全部完成后统一整合。
- 优势:速度快,总耗时约等于最慢的子任务。每个子任务拥有独立上下文,互不干扰。
- 劣势:Token成本是串行模式的N倍;合并层(Synthesize)面临结构不一致输出的融合挑战。
3.3 对抗验证模式(Adversarial Verification)
针对同一结论,多个Agent从“反驳”角度进行挑战,票数过半才算通过。由于验证者(Verifier)不了解工作者(Worker)的思路,仅看结果,从结构上消除了自评偏差。
实用价值:有效解决长期困扰的问题——AI倾向于顺着用户预期回答,产生“确认偏误”。对抗验证强迫AI寻找反例,基于数据和实验验证,而非迎合主观想法。
注意事项:验证者若给出错误判断,可能带偏Worker。因此,优选基于可复现的事实而非观点。此外,应限制AI找问题的边界,避免无限追究。
3.4 生成与过滤模式(Generate & Filter)
核心为发散再收敛:先刻意产生过量候选,再用标准(rubric)淘汰至精华,保留高置信度结果。
- 优势:多样性高。多个Generator可采用不同策略与提示词,产出人工难以预想的解法。
- 劣势:Filter的标准质量直接决定最终效果,设计错误即导致整个流程失效。
与拆分合并模式的区别:拆分合并是“拼图”——各处理任务的不同部分,结果互补;生成与过滤则是“选美”——各处理同一任务,结果竞争,大部分被丢弃。
3.5 锦标赛模式(Tournament)
通过竞争淘汰机制,N个Agent各自独立完成同一任务,经两两对比(pairwise judge)逐轮选出最优解。
- 优势:评判稳定性高。两两对比(“A和B哪个更好?”)比绝对评分(“给A打分”)更稳定,排除了评分标准漂移问题。
- 与生成与过滤模式的区别:锦标赛用pairwise judge进行两两比较,是“候选者互相竞争”;生成与过滤模式则是按标准筛选。
3.6 循环模式(Loop)
核心为自适应迭代:不断尝试,遇阻力则收集错误信息、补充上下文,直至满足验收条件。该模式本质是在对抗AI的随机性。
- 优势:唯一能处理“工作量未知”任务的模式。
- 劣势:存在失控风险——停止条件设计不佳可能导致无限循环;每轮Agent为全新上下文,无法积累跨轮状态(除非显式写入文件)。
四、个人Skill与官方工作流的对比
在Dynamic Workflows问世前,我设计了一套深度研究Skill,逻辑如下:
- 输入简单信息(如某项目上线新功能)
- AI搜索相关资料:官方文档、源代码、市场舆论
- 信息压缩为有意义的摘要
- 多Agent角色对抗分析,生成报告
- 自动去重
虽运行良好,但存在根本性缺陷:缺乏以目标为导向的收敛。去重过程常误删有价值信息,最终产出万字长文,却未直接说明“这件事与你有什么关系、你应该怎么做”。
研究终究为决策服务。这正是许多Skill止步80分的原因——缺少最关键的20分,仍需后续十余次对话才能达成满意结论。
Claude Code官方工作流的优势
对比发现,Claude Code内置的深度研究工作流多了几个关键环节:
- 问题拆解层:不直接开始搜索,而是先将问题拆解为多个子问题,明确调研目标。
- 可信度评估:对每条信息来源评估可证伪性,类似SEO权威性评分。
- 交叉删除而非平均合并:对每个结论进行多Agent投票,票数不足的删除,而非简单合并。
- 目标导向输出:报告围绕原始目标提供判断与建议方案,规避了“指令权重衰减”问题。
四大问题的结构化解决
动态工作流针对AI做长任务的典型问题提供了系统性解决方案:
| 问题 | 解决方案 |
|---|---|
| 目标漂移 | 自动加验收指标,防止任务中途偏离 |
| 过早停止 | 并行隔离上下文,避免任务未完成即停止 |
| 上下文污染 | 多Agent分摊上下文,前置Prompt控制在几k以内 |
| 输出偏向 | 对抗验证抵消迎合用户预期的问题 |
五、总结与展望
作为一名常年从事研究工作的从业者,Claude Code Dynamic Workflows的六种模式——路由选择、拆分合并、对抗验证、生成过滤、锦标竞选、循环模式——覆盖了绝大多数复杂研究任务的调度需求。从此无需手动设计Agent调度,也无需自行去重和交叉验证,这些均被内嵌至工作流中。
该机制尤其适合信息匮乏、开放性问题的探究,其天然的多Agent调度与任务目标拆分能力,使其通用性再次提升。相较于三年前AI仅擅长解决极为清晰的小问题,如今AI的质变更在于通用性——从固态解决一个问题,到适应任何问题。
Dynamic Workflows不是“更聪明的单次对话”,而是“研究流程本身的结构化”。原本需要十几次独立对话的调研,如今压缩至3-4次,尽管Token消耗增长了数十倍。
仍需保留3-4次交互的原因
- 验证机制的严苛度:区块链领域新技术研究中,官方文档常滞后,更值得参考的是开源代码和链上交易数据。目前AI默认以官方文档为准,而非事实性验证。
- 完全跨界的深度思考:AI擅长主流思考模型,但对非常新颖、深刻、缺乏数据依据的问题表现不足。
- 解决方案设计与验证:方案的价值在于验证与支持,需结合现有机制、投入与成本的衡量,这需精细调教。
- 极致的信息浓缩:需根据受众背景调整表达——从拟人化形象表述到一句话直击核心。
市场资讯部视点
Dynamic Workflows的推出标志着AI研究辅助工具从“被动应答”向“主动架构”的转变。传统AI工作流依赖用户预设路径,而动态工作流通过自动设计验收指标、对抗验证和目标收敛,显著提升了研究的深度与可信度。对于企业客户而言,这种结构化方式不仅降低了高质量调研的门槛,还有效避免了“信息堆砌”陷阱。然而,Token消耗的大幅增长和高度的专业预设需求,也意味着现阶段更适合有明确研究目标的高价值场景。市场趋势显示,未来AI工具将进一步针对行业特定需求(如金融、医疗、区块链)进行深度定制,以实现从通用性到专业性的真正跃迁。