什么是 Agent?从一份“翻车”的旅游攻略说起
最近在学 Agent 开发,有一些思考和总结,用最通俗的语言讲清楚两件事:什么是 Agent,它是怎么运行的。
一、先看人是怎么用大模型的
我们平时用 AI 很简单:你发一个问题,大模型思考后把答案返回给你。这个问题就是提示词(Prompt),整个过程一问一答,就是熟悉的聊天机器人模式。
但这种模式有个致命问题:大模型只会回答训练过的知识,涉及最新信息就抓瞎。 因为它基于历史数据训练,你问“上海今天天气怎么样”或者“某景点最新票价多少”,它都答不准。
举个例子。你让大模型“帮我制定一份五百元预算的上海一日游攻略”,它返回一份看起来很完美的攻略。但你上网一查,票价全涨价了,预算直接爆掉。
于是你只能自己动手:把景区、餐厅的最新价格全部查一遍,汇总后告诉大模型“这是最新信息,基于它重新规划”。这次,攻略才真正能落地。
复盘整个过程——发现价格不对的是人,做决策的是人,查工具的还是人。
二、Agent 的意义:把“人工”全部交给 AI
那这些操作能不能全部交给 AI?这就是 Agent 出现的意义。
Agent,就是具备自主决策、主动执行能力的 AI 系统。 它不仅有大模型的思考能力,还能自己调用工具、检查结果、决策规划。你把问题直接丢给它,它返回一个真正可落地的方案。
三、Agent 是怎么运行的
同样的问题发给 Agent,背后发生了什么?
首先接收问题的不是大模型,而是 Agent 的主程序,它负责整个系统的运行和调度。主程序不会把你的问题原封不动丢给模型,而是打包一个“工作资料包”,包括:用户提示词、规则(安全守则、不能编造内容等)、记忆(历史对话信息)、可用工具清单。这个打包后的信息,就是模型上下文。
大模型基于上下文思考:要做最新攻略,需要先查价格。于是它发起工具调用请求,主程序帮它执行——操作浏览器或调 API,查到最新信息后返回给模型。模型拿到信息完成规划,再检查是否满足预算规则,行程是否合理,最后把答案返回给用户。
值得强调的有两点:
- 整个过程是一个循环。
如果工具查回来的信息还不够,模型会继续发起调用,直到答案符合要求为止。思考、行动、检查,不断循环。 - 大模型本身没有记忆,是 Agent 赋予了它记忆。
Agent 把历史信息存在本地,每次与模型交互时都重新塞回上下文,所以你才觉得它“记得你”。
四、Agent 的四大核心能力
- 大模型
:大脑,负责思考、规划和决策; - 工具
:手脚,负责执行,查网页、调 API、操作文件; - 记忆
:记住历史对话,这是它显得聪明的原因; - 规则
:系统和用户规则,比如把“预算五百”写进规则,每次交互自动带上。
四大能力齐备,加上思考、行动、检查的循环,就是一个完整的 Agent。
五、Codex、Workbot、Tree 都是 Agent
它们能接相同的模型,能力却不同,差别就在工具和规则:编程类 Agent 内置代码工具和测试规则,办公类 Agent 内置办公工具。接什么模型不是关键,工具和规则的定义才是。
所以,你也完全可以搭配自己的规则和工具,搭建一个专属的简易 Agent——在扣子里创建智能体、写提示词、选工具、设全局规则,把预算写进规则里直接提问,就能看到它思考、调用工具、再思考的完整循环。
这就是 Agent 从理论到实践的全貌。觉得有用的话,点个关注,下期见。
📚最后,我还给大家整理好了,我面试用的一些资料,包括视频教程、面试题、Agent项目实战等,需要的留下“学习”我分享给你!
相关文章
发表评论
评论列表
- 这篇文章还没有收到评论,赶紧来抢沙发吧~