「AI Agent」什么是 AI Agent?

0 前言

本文内容整理自公众号「小林面试笔记」的文章 1. 什么是 Agent?与大模型有什么本质不同?,用于记录与总结 AI Agent 相关的核心面试知识点。


1 什么是 Agent?与大模型有什么本质不同?

1.1 回答

Agent(智能体)的本质是一个「自主闭环」的执行系统——它以 LLM 为大脑,以工具调用、记忆机制、多步推理与自我纠错的核心能力,通过「感知 → 规划 → 行动 → 再感知」的循环,自主完成复杂任务。

传统 AI / 普通大模型:你问它一个问题,它回答一个问题,每次调用都是独立的、被动响应的。它只是基于训练知识做问答,不知道上一步做了什么,也不知道下一步该做什么。
AI Agent:你只需要给它一个目标,它会自己把任务拆解成多步,通过 调工具、访问记忆、感知环境 一步步执行,直到目标完成。它不只是输出文字,而是能完成任务。

1.2 普通大模型的三大局限

普通大模型主要有三大局限:

  1. 知识被冻结:模型的训练数据有截止日期,你问它今天的天气、最新的股价,它完全不知道,因为它没有任何途径去获取实时信息。

  2. 不能行动:你让它帮你发邮件、帮你查数据库、帮你执行一段代码,它只能告诉你「你可以这样做」,但它自己做不到。因为普通大模型本质上就是一个文本生成器,所有输出都是一串文字。

  3. 没有持续状态:就算你想让它帮你做一件稍微复杂点的事,比如「先查资料再整理成报告」,它也干不了。每次调用之间它是完全失忆的,除非你手动把之前的对话塞进去,不然它根本不记得上一轮说了什么,更别说跨任务去记住你的偏好了。

这三个局限一环扣一环:知识是死的,手脚是没有的,记忆也是断的。加在一起,意味着普通 LLM 只能做「一问一答」的事情,稍微复杂一点的、需要多步骤协作的任务,它就完全无能为力了。

普通大模型的三大局限

1.3 Agent 特别在哪:感知 -> 规划 -> 行动 -> 再感知

AI Agent 有一个核心的运作闭环:

感知 -> 规划 -> 行动 -> 再感知

Agent 的核心运作闭环

你给它一个目标,比如「帮我调研竞品然后整理成报告」,它不是直接输出一段文字了事,而是先拆解任务,我要搜索哪些关键词、我要访问哪些网站、我要怎么组织内容,然后一步一步去执行,每一步的结果又反馈回来,指导下一步怎么做。

Agent 自主执行任务

Agent 多步执行示例


2 Agent 的三项核心支撑能力

2.1 工具调用(Tool Use):从「说话」变成「做事」

工具调用(Tool Use) 是让 Agent 从「说话」变成「做事」的关键。Agent 能调用外部工具,比如搜索引擎、代码执行器、数据库、API 等等。

不过这里有一个容易误解的地方:不是模型自己执行,而是模型「告诉你该调什么」,你的代码去真正执行,结果再反馈给模型。模型始终只是大脑,不是手脚。模型始终只是大脑,不是手脚。

为什么工具调用如此重要?因为它一下子突破了前面说的三大局限:

  • 知识被冻结?接上搜索引擎,模型就能获取实时信息。
  • 不能行动?接上邮件 API、代码执行器,模型就能真正做事。

这就好比一个人原来只能用嘴说话,现在给他配了手、脚和各种工具,能力上限瞬间拔高了一个量级。

举个最具体的例子。假设你给 Agent 配了两个工具:查天气和发邮件,然后让它「帮我查一下北京天气,发邮件给老板」:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
# 这里定义了两个工具,就像给 Agent 配了两个「技能说明书」
# 注意:这里没有一行真正执行的逻辑,只是告诉模型「我有哪些能力、需要哪些参数」
tools = [
{
"name": "get_weather",
"description": "获取指定城市的当前天气",
"parameters": {
"type": "object",
"properties": {
"city": {"type": "string", "description": "城市名称"}
},
"required": ["city"]
}
},
{
"name": "send_email",
"description": "发送邮件给指定收件人",
"parameters": {
"type": "object",
"properties": {
"to": {"type": "string"},
"subject": {"type": "string"},
"body": {"type": "string"}
},
"required": ["to", "subject", "body"]
}
}
]

# 你告诉 Agent:"帮我查一下北京天气,然后发邮件给 boss@company.com"
# Agent 不是一次性回答,而是分两步真正执行:
# 第一步:调用 get_weather(city="北京") → 得到 "晴天 15°C"
# 第二步:调用 send_email(to="boss@company.com", subject="今日天气", body="北京今天晴天 15°C")
# 每一步都是真实发生的,不是在"假装"

工具定义里没有一行执行逻辑,只有「名字、描述、需要哪些参数」,本质上就是一份说明书。模型读了这份说明书,自己决定该调哪个工具、参数填什么,然后把决策以 JSON 格式告诉你,真正执行的还是你的代码。这个「决策和执行分离」的思想,是理解工具调用最核心的一点。

工具调用:决策和执行分离

2.2 记忆机制:短期记忆 + 长期记忆

理解了工具调用之后,你会发现 Agent 光有「做事」的能力还不够,它还得「记事」。

传统 LLM 每次对话都是「失忆」的,除非你手动传上下文,不然它完全不记得上一次说了什么。而 Agent 系统通常会设计短期记忆长期记忆两层:

  • 短期记忆:当前任务执行过程中的中间状态,比如第一步搜索到了什么、第二步计算结果是多少,这些都存在 上下文 里,保证 Agent 不会做到一半忘了前面发生了什么。
  • 长期记忆:跨任务的,比如用户的偏好、历史操作记录,可以用 向量数据库 来存储,需要的时候做语义检索拿回来。也可以构建一个以 Markdown 为存储文件的长期记忆系统。

有了这两层记忆,Agent 在执行复杂任务时才能保持连贯性,不会走着走着忘了目标是什么。

Agent 的记忆机制

2.3 多步推理与自我纠错

那有了工具能做事、有了记忆能记事,Agent 就完整了吗?还差最后一块拼图,也是 Agent 最像「人」的地方。

多步推理和自我纠错 这一点经常被忽略,但其实是 Agent 区别于简单自动化脚本的关键。

Agent 在执行过程中如果某一步失败了,它不会直接崩掉,而是能 感知到失败、分析原因、换一种方式重试。比如用关键词 A 搜索没找到有用信息,它会自己换关键词 B 再搜一次;调用某个 API 报错了,它会看报错信息然后调整参数重新调用。

这就像一个真正在「思考」的执行者,碰到障碍会绕路走,而不是一条路走到黑。更进一步,它还能在完成某一步之后回头审视:我做的这步对不对?结果和预期一致吗?要不要调整后续的计划?

这种「边做边反思」的能力,让 Agent 在面对复杂、不确定的任务时,表现远比死板的自动化流程好得多。

讲完这三件事,我们用一个最直观的场景来感受一下差距。你让一个普通 LLM「帮我发一封天气播报邮件」,它能做的只是告诉你「你可以这样写代码……」;而一个 Agent,它会真的去调天气 API、拿到数据、组织邮件内容、再调邮件发送接口,整个过程自动完成。

这就是本质区别:从生成文字,到执行任务

Agent 与普通 LLM 的本质区别


参考

本文图片均来源于公众号「小林面试笔记」,版权归原作者所有。


「AI Agent」什么是 AI Agent?
https://marisamagic.github.io/2026/08/06/20260806_什么是Agent/
作者
MarisaMagic
发布于
2026年8月6日
许可协议