基础Agent架构初筛
AI Agent的感知-决策-执行循环是怎么运作的
考察候选人对AI Agent架构的理解——感知-决策-执行闭环与传统AI单向Pipeline的本质差异
#AI Agent#感知决策执行#Agent架构#传统AI对比
情景对话
大J
AI Agent和传统AI系统,你觉得本质区别在哪?别说「更智能」这种废话。
小Y
本质区别是「控制流的走向」。
传统AI是单向管道:输入进来,模型处理,输出结果,结束。整个流程是线性的,模型不知道自己的输出被怎么用了,也不会根据结果调整下一步。
AI Agent是一个闭环:它感知环境、做出决策、执行行动,然后把行动产生的结果再感知回来,驱动下一轮决策。这个循环不是由外部调度器控制的,而是Agent自己在跑。
关键词是「反馈」——Agent的行动会改变它所处的环境,这个改变又成为下一步推理的输入。传统AI没有这个自我修正的闭环。
大J
感知-决策-执行这三层,在工程实现上分别对应什么?
小Y
感知层负责把外部世界的信息转化为Agent能理解的表示。工程上包括:读文件、调API获取数据、处理图片或传感器信号、检索向量库。本质上是「信息获取+格式化」,把非结构化的世界转成结构化的上下文。
决策层是Agent的核心,现在基本都是LLM来承担。它拿到当前上下文,推理出「接下来应该做什么」——是调哪个工具、需要补充哪些信息、还是直接输出答案。LLM在这里扮演的是推理引擎的角色。
执行层负责把决策翻译成真实动作:调用外部API、写数据库、执行代码、控制设备。这一层是Agent和世界之间的接口,也是最需要做权限控制和失败处理的地方。
大J
传统AI里也有循环结构,比如强化学习——Agent和RL有什么区别?
小Y
嗯,这个问题挺好挖的。
形式上确实像——RL也是感知状态、选行动、拿奖励、更新策略,也是一个闭环。但有几个根本差异:
第一,RL的决策策略是训练出来的,需要大量环境交互才能收敛,很难泛化到新环境。Agent以LLM为核心,推理能力来自预训练,可以在见过的和没见过的任务上都用语言描述出「为什么这样做」。
第二,RL的行动空间通常是离散定义好的。Agent的行动空间是开放的——工具可以随时新增,LLM根据描述自己决定什么时候用哪个。
第三,RL对奖励信号的依赖很强,需要精心设计reward function。Agent用自然语言就能描述目标,不需要把目标量化成奖励。
大J
你在项目里有没有遇到过「用Agent替换传统AI模型」的场景?说说判断过程。
小Y
有。之前做过一个工业质检系统,最初是用图像分类器判断零件是否合格,准确率还行但有个硬伤——只能给出「合格/不合格」,说不出哪里有问题、为什么不合格。
我们当时的想法是升级成Agent:让它在发现异常时,去查产品规格手册找对应标准,再结合检测图给出详细的缺陷报告。
结果踩了个坑:质检是实时的,每件零件要在200ms内给结论,但Agent的多步推理加上RAG检索远远超过这个延迟要求。最后的方案是分层处理——分类器负责实时快速筛选,Agent只处理「疑似异常」这一小部分,离线生成详细报告。
这件事让我意识到一点:Agent适合「需要解释和推理」的任务,但对实时性敏感的场景,传统模型的直接预测往往更合适,两者结合才是正解。
大J
你说「分层处理」,这是一种常见的架构模式吗?
小Y
是的,有个词叫「Fast-and-Slow」,来自认知科学里的双系统理论。
快系统:用传统模型或规则做低延迟判断,覆盖90%以上的高置信度情况。
慢系统:用Agent处理快系统拿不准的情况,做更深入的推理和解释,时延要求可以宽松很多。
这个模式在工业上挺实用的。比如告警系统:传感器数据触发规则告警(快),Agent再去聚合多个传感器的历史数据、查维护记录、判断是否真的需要派人(慢)。单纯用传统模型会漏掉复杂关联,单纯用Agent会跟不上数据频率。
核心概念
AI Agent的核心结构:感知环境获取信息,决策层(LLM)推理下一步行动,执行层与真实世界交互,执行结果再反馈回感知层,形成自驱动闭环。
传统AI是「输入→模型→输出」的线性结构,模型不感知自身输出的后果;Agent是闭环,行动改变环境,环境变化驱动下一轮推理——这是两者的架构本质区别。
在Agent架构中LLM不是最终输出者,而是决策层的推理核心。它接收结构化上下文,输出「应该做什么」的决策,再由执行层把决策翻译成真实动作。
快系统(传统模型/规则)处理高频低延迟判断,慢系统(Agent)处理需要深度推理的复杂情况。两者结合既保证实时性,又覆盖传统模型力所不及的推理场景。
评分维度
延伸追问
感知质量是Agent的上限——垃圾进,垃圾出,再强的LLM也救不了噪声输入。工程手段包括:输入格式标准化和校验、多源交叉验证(两个传感器互相印证)、为LLM提供置信度标注(「这条数据来源可靠度低」)、以及对感知失败设置明确的fallback路径。
快层:基于规则和传统时序模型,实时监控电芯温度/电压/SOC,毫秒级触发保护动作(如过温断路)。慢层:Agent聚合多个电池组的历史数据、结合天气预报和用电曲线,推理最优的充放电策略,给出带解释的调度建议,由运维人员确认后执行。快层保安全,慢层做优化,职责分离。
几个方向:权限最小化(Agent只能调用任务必需的工具);干运行模式(先模拟执行给人review,再真实执行);不可逆操作强制确认;执行结果写入审计日志,方便事后追溯;以及为每个工具定义明确的错误语义,让Agent能区分「操作失败」和「操作结果为空」。