Skip to main content

经典模式 vs 分层代理

AutoGLM-GUI 提供两种代理工作模式,对应两种不同的任务结构。理解它们的差异,能帮你为任务选对模式。你可以在对话页顶部随时切换。

经典模式(Classic)

经典模式是开源 AutoGLM-Phone 的「原生形态」:一个视觉模型直接完成「理解任务 → 规划步骤 → 观察屏幕 → 执行动作」的完整闭环。

  • 优点:配置最简单、上手最快、链路最短
  • 适合:目标明确、步骤较少的任务,例如打开应用、简单导航、订外卖、打车
  • 机制:模型每一步看一张截图、输出一个动作,循环直到 finish 或达到最大步数

分层代理模式(Layered Agent,实验性)

分层代理是更「严格」的两层结构,把规划执行分开:

  • 规划层(决策模型):高层智能中枢,负责拆解任务、多轮推理、按反馈调整策略。它通过工具调用(如 list_devices()chat(device_id, message))来驱动执行层。
  • 执行层(autoglm-phone 视觉模型):只负责观察屏幕和执行原子子任务,每个子任务有步数上限(例如最多 5 步)。

分层代理模式

你能在界面里看到规划层每一次工具调用与返回结果,过程透明、便于调试。

  • 适合:需要多轮交互、需要「边看边问边改计划」的复杂任务,例如浏览/筛选/对比、多轮表单填写
  • 重要限制:执行层不负责「记笔记 / 保存中间信息 / 直接提取文本变量」。规划层需要信息时,必须通过提问让执行层把屏幕内容「念出来」。

分层代理的架构、数据流与实现细节见分层代理架构深入分析

怎么选

任务特征建议模式
常规、步骤少(订外卖、打车、签到)经典模式
需要多轮推理、动态调整策略分层代理模式
想要最简配置、快速验证经典模式
需要过程透明、便于调试迭代分层代理模式

分层代理需要额外配置一个决策模型(规划层用),决策模型偏向「会推理、上下文长」的通用大模型;执行层仍用 autoglm-phone