AI 时代 Agent 的演变过程
初代Agent
采用LLM + 提示词工程实现基础的模型对话能力,该阶段非常依靠LLM大模型本身的训练效果,存在非常大的随机性和不可控性问题。没有办法处理严肃场景的需求。
二代Agent
想要Agent能够解决实际工作和业务场景,除了增加提示词工程还是远远不够。从去年开始 Agent 的推理能力和参数规模增加,逐渐引入了 规划、记忆、工具使用 这三个核心功能。
自此 二代Agent 成型: Agent = LLM + 记忆 + 规划 + 工具
-
规划: 智能体能根据用户给定目标,自主拆解任务步骤去执行计划,例如 OpenManus。 对于特定领域还可以设定 Agent 的工作流,结合大模型的意图识别 和 流程控制,提升Agent处理复杂任务的稳定性。
-
记忆: 智能体具备长期记忆能力,能够存储和调用历史信息,还能压缩记忆,从而不断增加上下文长度,以及上下文的连贯性。
-
工具使用: 智能体虽然能够根据训练后的结果处理很多问题,但是特定场景以及外部调用还是无法做到。从而有了工具的出现,工具可以实现 API 调用、访问数据库、与外部世界交互等功能。之前爆火的MCP协议、还有最近流行的Agent Skill 本质上都是定义规范。
三代 Agent
为了解决单一Agent的局限性,多Agent的生态系统应运而生。这个阶段不再是单一的“全能型”Agent,而是构建多个Agent组成协作网络,每个Agent专注于负责特定领域的任务,通过 任务分发、Agent协同 来处理复杂的综合性任务。例如:软件开发场景,可以有产品经理Agent负责需求分析,架构师Agent负责架构设计,程序员Agent负责代码编写,测试Agent负责产品的质量测试,由它们协同工作完成整个软件开发周期。
三代 Agent 的好处就很多了:
- 任务聚焦:从“全能型”智能体的大量工具调用,拆分为单Agent的任务处理,拆分更细致,效果更显著。
- 功能独立:每个Agent都单独负责一块,出了问题只需要调整单个Agent即可。
- 问题拆解:复杂问题简单化,通过拆分成子任务,交由特定Agent去实现。
最后感慨几句:一门新技术的学习需要从宏观逐步聚焦在微观上,了解技术演进和核心原理才能更透彻的理解技术的本质,任何技术的使用都是可以简单几天就能学会的,在AI时代,即使不会使用,只有思路也都能让功能实现。
