「AI Agent」什么是 AI Agent?
0 前言
本文内容整理自公众号「小林面试笔记」的文章 1. 什么是 Agent?与大模型有什么本质不同?,用于记录与总结 AI Agent 相关的核心面试知识点。
1 什么是 Agent?与大模型有什么本质不同?
1.1 回答
Agent(智能体)的本质是一个「自主闭环」的执行系统——它以 LLM 为大脑,以工具调用、记忆机制、多步推理与自我纠错的核心能力,通过「感知 → 规划 → 行动 → 再感知」的循环,自主完成复杂任务。
传统 AI / 普通大模型:你问它一个问题,它回答一个问题,每次调用都是独立的、被动响应的。它只是基于训练知识做问答,不知道上一步做了什么,也不知道下一步该做什么。
AI Agent:你只需要给它一个目标,它会自己把任务拆解成多步,通过 调工具、访问记忆、感知环境 一步步执行,直到目标完成。它不只是输出文字,而是能完成任务。
1.2 普通大模型的三大局限
普通大模型主要有三大局限:
-
知识被冻结:模型的训练数据有截止日期,你问它今天的天气、最新的股价,它完全不知道,因为它没有任何途径去获取实时信息。
-
不能行动:你让它帮你发邮件、帮你查数据库、帮你执行一段代码,它只能告诉你「你可以这样做」,但它自己做不到。因为普通大模型本质上就是一个文本生成器,所有输出都是一串文字。
-
没有持续状态:就算你想让它帮你做一件稍微复杂点的事,比如「先查资料再整理成报告」,它也干不了。每次调用之间它是完全失忆的,除非你手动把之前的对话塞进去,不然它根本不记得上一轮说了什么,更别说跨任务去记住你的偏好了。
这三个局限一环扣一环:知识是死的,手脚是没有的,记忆也是断的。加在一起,意味着普通 LLM 只能做「一问一答」的事情,稍微复杂一点的、需要多步骤协作的任务,它就完全无能为力了。

1.3 Agent 特别在哪:感知 -> 规划 -> 行动 -> 再感知
AI Agent 有一个核心的运作闭环:
感知 -> 规划 -> 行动 -> 再感知

你给它一个目标,比如「帮我调研竞品然后整理成报告」,它不是直接输出一段文字了事,而是先拆解任务,我要搜索哪些关键词、我要访问哪些网站、我要怎么组织内容,然后一步一步去执行,每一步的结果又反馈回来,指导下一步怎么做。


2 Agent 的三项核心支撑能力
2.1 工具调用(Tool Use):从「说话」变成「做事」
工具调用(Tool Use) 是让 Agent 从「说话」变成「做事」的关键。Agent 能调用外部工具,比如搜索引擎、代码执行器、数据库、API 等等。
不过这里有一个容易误解的地方:不是模型自己执行,而是模型「告诉你该调什么」,你的代码去真正执行,结果再反馈给模型。模型始终只是大脑,不是手脚。模型始终只是大脑,不是手脚。
为什么工具调用如此重要?因为它一下子突破了前面说的三大局限:
- 知识被冻结?接上搜索引擎,模型就能获取实时信息。
- 不能行动?接上邮件 API、代码执行器,模型就能真正做事。
这就好比一个人原来只能用嘴说话,现在给他配了手、脚和各种工具,能力上限瞬间拔高了一个量级。
举个最具体的例子。假设你给 Agent 配了两个工具:查天气和发邮件,然后让它「帮我查一下北京天气,发邮件给老板」:
1 | |
工具定义里没有一行执行逻辑,只有「名字、描述、需要哪些参数」,本质上就是一份说明书。模型读了这份说明书,自己决定该调哪个工具、参数填什么,然后把决策以 JSON 格式告诉你,真正执行的还是你的代码。这个「决策和执行分离」的思想,是理解工具调用最核心的一点。

2.2 记忆机制:短期记忆 + 长期记忆
理解了工具调用之后,你会发现 Agent 光有「做事」的能力还不够,它还得「记事」。
传统 LLM 每次对话都是「失忆」的,除非你手动传上下文,不然它完全不记得上一次说了什么。而 Agent 系统通常会设计短期记忆和长期记忆两层:
- 短期记忆:当前任务执行过程中的中间状态,比如第一步搜索到了什么、第二步计算结果是多少,这些都存在 上下文 里,保证 Agent 不会做到一半忘了前面发生了什么。
- 长期记忆:跨任务的,比如用户的偏好、历史操作记录,可以用 向量数据库 来存储,需要的时候做语义检索拿回来。也可以构建一个以 Markdown 为存储文件的长期记忆系统。
有了这两层记忆,Agent 在执行复杂任务时才能保持连贯性,不会走着走着忘了目标是什么。

2.3 多步推理与自我纠错
那有了工具能做事、有了记忆能记事,Agent 就完整了吗?还差最后一块拼图,也是 Agent 最像「人」的地方。
多步推理和自我纠错 这一点经常被忽略,但其实是 Agent 区别于简单自动化脚本的关键。
Agent 在执行过程中如果某一步失败了,它不会直接崩掉,而是能 感知到失败、分析原因、换一种方式重试。比如用关键词 A 搜索没找到有用信息,它会自己换关键词 B 再搜一次;调用某个 API 报错了,它会看报错信息然后调整参数重新调用。
这就像一个真正在「思考」的执行者,碰到障碍会绕路走,而不是一条路走到黑。更进一步,它还能在完成某一步之后回头审视:我做的这步对不对?结果和预期一致吗?要不要调整后续的计划?
这种「边做边反思」的能力,让 Agent 在面对复杂、不确定的任务时,表现远比死板的自动化流程好得多。
讲完这三件事,我们用一个最直观的场景来感受一下差距。你让一个普通 LLM「帮我发一封天气播报邮件」,它能做的只是告诉你「你可以这样写代码……」;而一个 Agent,它会真的去调天气 API、拿到数据、组织邮件内容、再调邮件发送接口,整个过程自动完成。
这就是本质区别:从生成文字,到执行任务。

参考
本文图片均来源于公众号「小林面试笔记」,版权归原作者所有。