跳转到内容

LLM 推理与 Agent 范式

LLM 推理与 Agent 范式地图


  • 一句话定义
  • 提示写法要点(zero-shot / few-shot)
  • 适用边界:什么题好用、什么题会翻车
  • 与「直接答」对比时的收益点
  • 待补:示例 prompt、失败样例
  • 与 CoT 的关系(N 条独立采样 + 聚合)
  • 投票 / 聚合方式怎么选
  • 成本公式:N × CoT
  • 何时值得开、何时不如加一次检索或工具
  • 待补:数学题小实验记录
  • 树节点:生成 → 评估 → 扩展 / 剪枝
  • 搜索策略(BFS / DFS / beam)怎么选
  • 相对 CoT:多路径 vs 单路径
  • 成本与搜索空间爆炸的控制手段
  • 待补:24 点或谜题最小实现草图
  • 相对 ToT:图操作(聚合、交叉引用)解决什么
  • 节点 / 边语义怎么建模
  • 工程复杂度:状态、记忆、调度
  • 适合的「多证据合并」场景清单
  • 待补:与 ToT 的对比表(自写,不抄总表)
  • 自然语言推理 → 代码 → 解释器
  • 与「LLM 直接算」的分工
  • 沙箱 / 执行环境注意点
  • 不适合编码化的问题类型
  • 待补:一道统计或符号计算示例
  • 递归拆分与合并的接口约定
  • 拆分质量差时的症状与修补
  • 子误差如何向上传播
  • 与 ToT / Plan-and-Execute 的边界
  • 待补:长文档分析拆分模板
  • LLM 在 MCTS 里扮演的角色(策略 / 价值 / 模拟)
  • 探索-利用如何调
  • 相对 ToT 的「模拟 rollout」多带来什么
  • 成本与调参清单
  • 待补:简化伪代码或流程图
  • 检索 → 塞入上下文 → 再推理的流水线
  • 检索噪声如何伤推理
  • 与「纯 CoT」何时组合
  • chunk / top-k / 重排要点(提纲级)
  • 待补:私有知识库问答最小链路
  • Thought / Action / Observation 一轮长什么样
  • 工具 schema 与停止条件
  • 长任务迷失、上下文膨胀、死循环的对策提纲
  • 作为后续 Plan-and-Execute / Reflexion 的底座
  • 待补:一个联网或 API 调用最小轨迹
  • Planner 与 Executor 的职责切分
  • 何时重规划、触发条件怎么定
  • 相对 ReAct:全局路线 vs 逐步摸索
  • 初始计划错误时的补救
  • 待补:多步骤工单式任务模板
  • 生成 → 批评 → 改写 的单上下文循环
  • 批评 prompt 写什么才有用
  • 与 Reflexion 的差异(有无跨 trial 记忆)
  • 适合润色、不适合纠「事实错」的边界
  • 待补:写作前后对比样例
  • 在 ReAct / Plan-and-Execute 之上加「失败复盘记忆」
  • 反思文本存什么、下次怎么注入
  • 错误经验污染的风险
  • 重试预算与停止策略
  • 待补:代码调试一次成功 / 失败轨迹
  • 自问子问题直到可答的节奏
  • 与 DnC、CoT 的异同
  • 无限自问的熔断条件
  • 适合「隐含子问题」的题型
  • 待补:问答拆解示例
  • 「预训练学会何时调工具」与「prompt 教调工具」的差别
  • 对通用 LLM 的可迁移性限制
  • 和现代 function calling / tool use 的谱系关系
  • 待补:相关论文要点与今日实践对照
  • 诘问链:质疑假设而非直接给答案
  • 适合审查、辩论、风控的用法
  • 发散失控时如何收束
  • 待补:一段假设检验对话骨架
  • 主管拆分 / 分派 / 汇总;工人执行
  • 通信协议与状态汇总
  • 主管能力成为瓶颈时的表现
  • 与 CrewAI 一类框架的映射(提纲)
  • 待补:三角色协作任务草图
  • 生成与评审解耦的价值
  • 校验器 checklist 怎么设计
  • 双模型同偏见时怎么办
  • 待补:代码评审双 Agent 流程
  • 对立视角、轮次、收敛规则
  • 减少单边盲区的机制直觉
  • 跑题与成本控制
  • 待补:正反方 + 裁判的最小协议
  • 按题选策略(CoT / ToT / 检索…)的路由器
  • 路由特征:难度、是否需工具、是否可投票
  • 路由错了的回退策略
  • 待补:简易分类规则或模型路由草案
  • 用推理轨迹做训练数据,失败样本如何扩增
  • 与「只改 prompt」的本质差别(改权重)
  • 数据筛选与泄漏注意点
  • 待补:训练闭环示意(数据 → 微调 → 评测)

  • 范式名混用(业界同一缩写多义)时,文中先给全称再缩写
  • 对比实验未控制 token / 工具权限时,结论不可比
  • 后续按「纯推理 → 工具 Agent → 多智能体 → 训练」四条线补示例,比按字母顺序补更易建立地图感