刚接触 AI 项目时,最容易让人退缩的往往不是代码,而是一串看起来都懂、放在一起却分不清的词:AI、LLM、Prompt、Agent、RAG、Tool、Memory。
有人说 Agent 会使用 Tool,有人说 RAG 可以给模型增加知识,还有人说做好 Prompt 就能让 AI 记住要求。每句话听起来都像对的,但它们说的其实不是同一层东西。
我们先不背定义。想象公司来了一位新同事,你希望他帮你完成一份周报:他要能读懂你的要求,查看项目资料,找到本周进展,记住团队习惯,最后整理成固定格式。把这个场景拆开,七个概念就会清楚很多。
可以先记住这张简单的关系图:
AI:整片技术领域
└─ LLM:擅长处理语言的“大脑”
├─ Prompt:你交代任务的方式
├─ Tool:它可以使用的外部工具
├─ Memory:它用来延续信息的笔记本
└─ RAG:它先查资料、再回答的方法
Agent:把模型、任务说明、工具、资料和执行步骤组织起来完成目标的系统
这张图不是严格的技术架构,但很适合建立第一层直觉。下面我们逐个拆开。
AI:不是一个软件,而是一大片技术
AI 是 Artificial Intelligence,也就是人工智能。它不是某一个聊天网站、某一个模型或某一种写代码工具,而是一类让机器完成“看起来需要智能”的任务的技术总称。
例如:
- 手机相册自动识别人脸;
- 地图根据路况预测到达时间;
- 邮箱判断一封邮件是不是垃圾邮件;
- 聊天工具帮你总结文章、生成图片或修改代码。
这些都可以属于 AI,但背后的技术不一定相同。
生活里,“交通工具”是一个大类,汽车、火车和自行车都是交通工具,但交通工具不等于汽车。类似地,LLM 属于 AI 的一种重要技术,但 AI 不等于 LLM。
所以当别人说“我在做 AI 项目”时,这句话仍然很宽。它可能是在做图像识别、语音转文字,也可能是在做一个由大语言模型驱动的助手。
LLM:特别会处理语言的大脑
LLM 是 Large Language Model,也就是大语言模型。它从大量文本中学习语言的规律,可以根据上下文生成接下来合适的内容。我们平时看到的问答、总结、翻译、写作和代码生成,很多都由 LLM 完成。
在“新同事写周报”的场景里,LLM 像这位同事负责阅读、理解和表达的大脑。你给他几段零散进展,他能看懂大意、整理结构,再写成连贯的文字。
不过,大脑会说话,不代表它天然知道所有事实,也不代表每次判断都正确。LLM 可能遇到这些问题:
- 它训练时没有见过你公司刚刚更新的资料;
- 它不知道你电脑里的文件放在哪里;
- 它可能把不确定的内容说得很肯定;
- 它通常不能只靠“想一想”就真的发送邮件或修改数据库。
因此,LLM 是许多现代 AI 应用的核心能力,但它不是完整应用。要让这个“大脑”可靠地完成工作,还需要任务说明、外部资料、工具和流程。
Prompt:不是咒语,而是任务说明
Prompt 通常被翻译为提示词。最简单的 Prompt 可以是一句话,例如“帮我写一份周报”。但在真实项目里,更有用的 Prompt 往往还包含背景、限制和期望输出。
继续把 AI 当成新同事。如果你只说“写一下周报”,他很可能不知道写谁的、写哪一周、要多长、交给谁看。更清楚的交代方式会是:
请把下面的项目记录整理成本周周报,面向不了解技术细节的负责人。按“本周完成、当前风险、下周计划”三个部分输出,不要补写记录中没有的信息;缺少关键内容时先列出待确认项。
这段话里已经有了几类重要信息:
- 任务:整理周报;
- 背景:读者不了解技术细节;
- 格式:分成三个部分;
- 边界:不能编造;
- 异常处理:信息不足时先提问。
生活中,Prompt 就像任务单。任务单越清楚,新同事越容易做对;但任务单写得再详细,也不能代替资料、权限和工具。你不能只在 Prompt 里写一句“请查看我电脑上的文件”,就假设模型已经拥有读取文件的能力。
Tool:让模型不只会说,还能做事
Tool 是 AI 应用提供给模型调用的外部能力。模型负责判断什么时候需要某种能力,并生成符合规则的参数;真正读取文件、查询天气、调用接口或写入数据库的,通常是程序代码。
对新同事来说,Tool 就像他桌上的浏览器、计算器、表格软件和公司系统账号。没有这些工具,他可以告诉你“我打算查一下任务记录”,却不能真的把记录取回来。
常见的 Tool 包括:
- 读取或写入文件;
- 搜索网页;
- 查询数据库;
- 调用天气、地图或支付接口;
- 创建日程、发送消息;
- 运行一段程序或命令。
工具让 AI 从“生成一段文字”走向“影响外部世界”,同时也带来新的边界。读取公开网页和删除生产数据显然不是同一种风险。一个可靠的 AI 项目需要明确每个工具能做什么、需要哪些参数、失败时返回什么,以及哪些操作必须由人确认。
当工具和外部资源越来越多时,你还会遇到 MCP 这类连接协议。现在只需要知道它们能帮助 AI 应用用更统一的方式发现和使用工具;具体怎么接,我们留到后面的实战文章再讲。
Memory:让下一步不必每次从零开始
Memory 是让 AI 系统保留并再次使用信息的机制。它可以保存用户偏好、历史对话摘要、任务状态,或者一次工作尚未完成的中间结果。
在周报场景里,Memory 像新同事的笔记本。他可能记着:
- 你喜欢简短直接的表达;
- 周报固定分成哪几个部分;
- 上周还有哪个风险没有解决;
- 这次任务已经处理到哪一步。
Memory 不等于把所有聊天记录永远塞给模型。信息越多不一定越好,过时内容还可能干扰当前判断。实际项目通常会选择真正值得保留的内容,并决定保存多久、何时更新、何时删除。
还要注意:模型在当前对话里能看到前文,不一定代表它下次打开时仍然记得。跨会话的记忆通常需要应用把信息保存到文件或数据库,再在合适的时候取回来。
所以,“这个 AI 记得我”往往不是模型突然拥有了人类式记忆,而是系统在背后做了保存、筛选和重新提供。
RAG:先去资料库找,再结合问题回答
RAG 是 Retrieval-Augmented Generation,也就是检索增强生成。这个名字听起来很重,做的事却很好理解:先从外部资料中找出与问题最相关的内容,再把这些内容交给模型生成回答。
它很像开卷考试。
如果你问新同事:“本周登录功能修了哪些问题?”他没有必要只凭脑子猜。他可以先到项目文档、任务记录和会议纪要里查找“登录功能”,挑出相关片段,再根据这些材料回答。
一个简化的 RAG 过程是:
提出问题 → 检索相关资料 → 把资料和问题一起交给模型 → 生成回答
RAG 适合处理模型训练时不知道、经常变化,或者只属于你自己的知识,例如公司制度、产品文档、课程笔记和项目代码。
但 RAG 不等于 Memory。RAG 关注的是“这次回答应该查哪些资料”,Memory 关注的是“哪些信息需要跨步骤或跨会话保留下来”。资料库里的一份产品手册更像可检索知识;“用户习惯看精简版答案”更像用户记忆。
RAG 也不会自动保证答案正确。如果检索没有找到关键资料,或者资料本身已经过时,最后的回答仍可能出错。因此,一个认真设计的 RAG 应用还会关心资料来源、更新时间、引用和找不到答案时该怎么办。
Agent:围绕目标连续行动的系统
Agent 常被翻译为智能体。它与普通聊天回答最直观的差别是:Agent 不只是收到一句话、返回一句话,而是能围绕目标决定下一步,调用工具,观察结果,再继续行动,直到完成任务、遇到停止条件,或者需要人来确认。
让 Agent 完成周报,它可能会走过这样的过程:
- 理解周报的格式和时间范围;
- 读取本周任务记录;
- 找出与你有关的进展;
- 发现某条记录缺少结果,于是向你确认;
- 生成周报并检查是否遗漏风险;
- 保存到指定文件;
- 在真正发送之前请你确认。
这个过程里,LLM 负责理解、判断和生成内容,Prompt 说明目标与规则,Tool 负责读取和保存,Memory 保留偏好与状态,RAG 可以从大量资料中找到相关片段。Agent 则把这些部分组织成一段可以执行的工作流。
因此,Agent 不是“更大的模型”,也不只是“更长的 Prompt”。它更像一个完整系统。模型有多聪明很重要,但工具权限、执行步骤、失败处理和人工确认同样决定它能不能可靠工作。
当然,并不是步骤越多就越像 Agent,也不是所有问题都需要 Agent。翻译一句话、润色一段文案,用一次模型调用往往已经足够。只有当任务真的需要分步处理、使用工具和根据结果继续判断时,Agent 才更有价值。
聊天机器人、RAG 应用和 Agent 项目有什么区别
这三类应用不是互相排斥的产品名称,而是三种不同的能力重点。一个聊天界面背后可以接 RAG,也可以运行 Agent。为了建立直觉,我们仍然可以用“写周报”来对比:
| 类型 | 它会怎么做 | 适合什么任务 |
|---|---|---|
| 普通聊天机器人 | 你贴出几段进展,它根据当前对话直接生成周报 | 翻译、润色、总结、问答等单次生成任务 |
| RAG 应用 | 它先从项目文档中检索相关进展,再根据找到的资料回答 | 基于私有资料、最新知识或大量文档的问答 |
| Agent 项目 | 它自己读取多个来源、判断缺少什么、调用工具、生成并检查结果,必要时请你确认 | 需要多步骤、外部操作和过程控制的任务 |
判断一个项目属于哪一类,可以问三个问题:
- 它主要是在根据当前输入生成一次回答吗?这更接近普通聊天应用。
- 它需要先从外部知识库找资料吗?这用到了 RAG。
- 它需要自己决定下一步、连续调用工具并检查结果吗?这开始接近 Agent。
同一个项目也可能同时回答“是”。例如,一个客服 Agent 可以通过聊天界面接收问题,用 RAG 查产品手册,再调用订单工具完成退款申请。概念的作用不是给产品贴上唯一标签,而是帮助我们看清系统里分别有哪些能力。
把七个词重新放回一张桌子上
最后,再回到那位新同事:
- AI 是我们讨论的整片技术领域;
- LLM 是特别擅长理解和生成语言的大脑;
- Prompt 是你交代任务、背景、限制和输出要求的方式;
- Tool 是它读取文件、查询系统和执行操作时使用的工具;
- Memory 是保存偏好、历史和任务状态的笔记本;
- RAG 是遇到知识问题时先查相关资料、再组织答案的方法;
- Agent 是把这些能力串起来,围绕目标连续完成工作的系统。
你不需要在第一天就掌握它们的所有实现细节。先能听懂、能区分,已经足够开始下一步。
下一篇,我们会继续聊 Vibe Coding 到底是什么:当你还不会完整写出一个项目时,怎样与 coding agent 分工,怎样描述目标、运行结果、反馈问题,再把一个小想法一点点做成能跑的东西。
本系列目录
这是「AI / Vibe Coding 新手系列」的第 1 篇,全系列共六篇:
- 先听懂:AI、LLM、Prompt、Agent、RAG、Tool、Memory 到底是什么(当前篇)
- Vibe Coding 是什么:不会完整写代码,也能把想法变成项目
- 做第一个 Agent 前,要准备哪些东西
- 实战:用 Vibe Coding 做一个最小 Agent
- 让 Agent 更像项目:工具、记忆、文件读写和简单界面
- 从能跑到好用:怎么调 prompt、看错误、让 AI 帮你修 bug
延伸阅读(比本系列更偏工程化,建议跑通第一个 Agent 后再看):从 Demo 到可交付:如何做一个 Agent 项目
