LL
2026-04-22
来自广东
思考题 可以插入 自我审查完成之后 审查不通过带着审察信息返回phase1 审查通过进入phase2
1
晴天了
2026-04-22
来自北京
思考题: 每次循环到 phase 1后, 即把phase1 的消息返回给用户让用户确认 如果用户确认, 继续走phase 2 如果用户否认, 把phase 1 的消息 和用户否认的消息连同加入到 上下文中. 并拿着上下文 重新走 phase 1的循环.
1
lJ
2026-04-22
来自江苏
思考题: 可以插入一个自我审查的微循环。Phase 1 得到 thinkResp 后,不急着把它追加到主 context,而是单独发起一次 Critic 调用——用独立的 system prompt 让模型以"审判者"身份评审这份计划,输出通过/拒绝结论。如果计划被否,就重新触发 Phase 1 重新规划(设置最大重试次数防止死循环);只有通过审查后,才把思考结果追加到 context 并进入 Phase 2 执行。这样既解决了 Token 浪费(有缺陷的 thinking trace 不进主 context),也解决了内容泄露(整个审查过程内部流转),更重要的是加了一道防止盲目执行的防火墙,本质上是给慢思考再套一层元认知。 疑问: 两阶段 ReAct 的核心是"机制决定行为",用架构锁住模型的冲动。但现在有些前沿模型宣称已具备原生慢思考能力。请问老师,在工程选型上,我们如何判断一个模型的原生 Thinking 是否可靠到足以弱化两阶段架构的必要性?还是说即便模型能力足够,两阶段架构依然有其不可替代的工程价值——比如 trace 可观测性、Critic 介入点、以及对任意模型的通用性? 在两阶段架构中,每一 Turn 的 thinking trace 都被追加到 contextHistory。短期来看,当前 Turn 的 trace 对 Phase 2 几乎肯定有益(自回归锚定,模型顺着自己的逻辑走)。但多 Turn 之后,早期规划可能已经过时甚至是错误的,积累在 context 里会不会反而锚定模型、产生路径依赖?工程上是否需要对历史 thinking trace 做老化处理或摘要压缩?
展开