Agent:给话痨配上手脚和待办清单 | AI 三部曲②
《Agent:给话痨配上手脚和待办清单》
从"会说"到"会干",就差一个外挂 · 阅读约 8 分钟 · 无需技术背景
开场小剧场军师只有嘴,是个什么体验
上一篇我们认识了大模型:一个读完整个互联网的超级话痨。
但它有个尴尬的处境——只有嘴。
你问它:"帮我订一杯冰美式。"
它答得那叫一个漂亮:"好的!建议您打开外卖软件,搜索咖啡店,选择冰美式,下单即可!一步一步,条理清晰,语气温柔。"
然后呢?没有然后了。它既打不开软件,也下不了单,连你家楼下的门都出不去。一位军师,运筹帷幄之中,决胜千里之外——但自己连杯水都倒不了。
于是工程师们干了一件事:给话痨配上手脚、眼睛和待办清单。这套装了外挂的大模型,就是 Agent(智能体)。
大模型
会说不会做
参谋部里的嘴强王者
大模型 + 工具
会说也能做一点
但干完就忘,没有全局观
Agent
会规划、会用工具、有记性
还会复盘纠错
Agent 的四大装备嘴巴之外,配齐全身
一个合格的 Agent,除了那张厉害的嘴(大模型大脑),还得配四样装备:
待办清单(规划)
把"帮我办婚礼"这种大目标,自动拆成一张 Excel 级待办清单:定日子、找场地、比报价……先做什么后做什么,安排得明明白白。
工具箱(工具调用)
能真的去查天气、搜网页、订机票、算表格。相当于给 Siri 接上了全套外卖、打车、银行 App。
记事本(记忆)
记住前面干了什么、你交代过什么。不然干到第三步就忘了你是谁,像极了周一早上的你。
复盘能力(反思)
干砸了会问自己"哪一步出了问题",然后换个方法重来。不会一条道走到黑。
其中最关键的是待办清单。普通大模型回答问题是"一步出答案",Agent 是"先列计划、再分步执行、边干边看"——这就是"会说"和"会干"的本质区别。
现场演示:Agent 点咖啡一句"随便",背后的连锁反应
你说:"帮我点杯咖啡,随便,别太苦。"
对大模型来说,这句话只能换来一段"点咖啡建议"。但对 Agent 来说,好戏开场了:
注意到了吗?整个过程它做了四次决策:查天气定冷热、搜店铺比评分、结合"别太苦"选口味、最后汇报。每一步都是大脑在接话,但每一步的结果都变成了真实的动作。
"随便"两个字对人类是刁难,对 Agent 是一次标准的任务拆解。
最像人的部分:越挫越勇干砸了,不会装没事
Agent 还有一项顶级职场素养:复盘。
假设它搜咖啡店时网断了,拿不到结果。普通程序会直接报错罢工,Agent 会退一步想:"搜索用不了,那我换地图 App 试试?还不行,我根据记忆里的常识推荐一家,并告诉你数据可能不准。"
这套循环叫感知 → 规划 → 行动 → 反思,出问题就回到规划那步重来,像极了被甲方打回第五版方案还微笑改稿的你。
当然,也别吹过头:今天的 Agent 依然会犯低级错误——比如兴冲冲把"冰"美式下成"热"的,然后被你抓包时一本正经地解释。手脚是配上了,但大脑偶尔还是会幻觉上头。
本篇速记卡三句话带走,饭桌上够用了
1️⃣ Agent = 大模型(大脑)+ 规划、工具、记忆、反思四大装备。
2️⃣ 核心区别:大模型"一步给答案",Agent"列计划、分步干、边干边看"。
3️⃣ 它已经很能干,但依然会犯错,重要的事得盯一眼。
问题来了
一个会说又会干的全能实习生进场了——
你的工位还坐得稳吗?
终极篇聊聊:打工人自救指南。


