06 // CHAPTER ROUTE

让大模型 长出手脚

AI基础 · 第六章

Agent 把“会说”的大模型接上感知、规划、工具与执行:它不只回答问题,也能围绕目标把事情做完。

SECTION 01 / 阅读地图

小节一 · 从“回答”到 “完成任务”

本节导读

AI 怎样从一次回答,升级为能记忆、会调用工具并持续完成任务的 Agent?

01

从“回答”到 “完成任务”

LLM 负责理解与生成;Agent 再接入感知、工具与执行通道。

关键线索理解与生成感知通道工具与执行
02

Agent 的四步闭环

感知任务、规划步骤、调用工具、执行反馈,循环修正而不是一次直线。

关键线索感知与规划工具调用执行与反馈
03

Agent 为什么需要记忆

短期记忆保留当前上下文,长期记忆按需找回过去经验。

关键线索短期:当前上下文长期:过去经验按需检索
04

在虚实之间先推演再行动

数字孪生让 Agent 先在虚拟环境验证策略,再连接真实设备。

关键线索虚拟验证策略调度连接设备

Agent 的核心不是多说一步,而是形成“感知—规划—行动—反馈”的可执行闭环。

VISUAL RECAP

本节场景补充

READ THE SCENE

从“回答”到 “完成任务”

从回答问题转向完成任务,关键是让模型会调用合适的工具。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节一 · 从“回答”到 “完成任务””讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节一 · 从“回答”到 “完成任务”

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

01 // AGENT VS LLM

从“回答”到
“完成任务”

传统 LLM

你问一句,我答一句。它擅长理解与生成文本,却无法主动进入外部世界。

VS

AI Agent

主动感知环境、拆解目标、调用工具并执行,让输出进入真实的任务流程。

LLM 像聪明的大脑;Agent 为它接上眼、耳、手、脚与工具箱。

02 // WORK LOOP

Agent 的
四步闭环

感知、规划、工具调用、执行不是一次直线,而是带反馈的迭代闭环。

03 // MEMORY

Agent 为什么
需要记忆

上下文让 Agent 记住眼前,向量检索让它按需找回过去。

04 // TWIN DISPATCH

在虚实之间
先推演再行动

在数字孪生平台中,Agent 是把感知、策略与设备控制串起来的调度引擎。

SECTION 02 / 阅读地图

小节二 · ReAct: 想一步,做一步

本节导读

按编号进入后续页面,逐项核对核心主张、工作机制与应用边界。

01

ReAct: 想一步,做一步

ReAct 用“思考—行动—观察”反复校正,让复杂任务不靠一次猜完。

02

函数调用是通信协议

Function Calling 让模型以稳定的结构化请求,安全地连接外部工具。

03

心法加招式: ReAct + Function

ReAct 决定怎么思考,Function Calling 让行动以可靠协议落地。

关键线索ReActFunction Calling

先看主张,再沿编号核对机制、证据与应用边界。

VISUAL RECAP

本节场景补充

READ THE SCENE

ReAct: 想一步,做一步

思考、行动、观察反馈构成 ReAct 的逐步闭环。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节二 · ReAct: 想一步,做一步”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节二 · ReAct: 想一步,做一步

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

05 // REACT

ReAct:
想一步,做一步

ReAct 用“思考—行动—观察”反复校正,让复杂任务不靠一次猜完。

06 // FUNCTION CALL

函数调用是
通信协议

Function Calling 让模型以稳定的结构化请求,安全地连接外部工具。

07 // BEST PRACTICE

心法加招式:
ReAct + Function

ReAct 决定怎么思考,Function Calling 让行动以可靠协议落地。

SECTION 03 / 阅读地图

小节三 · 任务变复杂时如何分工

本节导读

按编号进入后续页面,逐项核对核心主张、工作机制与应用边界。

01

任务变复杂时如何分工

能否清晰拆分任务、是否需要不同专长,以及预算与延迟,共同决定架构选择。

02

多 Agent 有四种队形

多 Agent 的重点不在“数量”,而在于让协作拓扑匹配任务依赖关系。

03

大脑与身体之间需要一座桥

具身智能中,Agent 把“会想”的大脑接到“能做”的身体,并承担安全与反馈。

04

Agent 进入现实要过四道关

从屏幕走向物理世界,实时、安全、融合与迁移都必须成为系统边界。

先看主张,再沿编号核对机制、证据与应用边界。

VISUAL RECAP

本节场景补充

READ THE SCENE

任务变复杂时如何分工

复杂任务可拆给不同角色,再把中间结果汇合。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节三 · 任务变复杂时如何分工”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节三 · 任务变复杂时如何分工

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

08 // ONE OR MANY

任务变复杂时
如何分工

单 Agent

适合个人助手、单一领域问答、简单自动化。架构简单、上下文一致、响应较快,但复杂任务容易成为单点瓶颈。

多 Agent

面对需求分析、架构设计、编码、安全审计等可拆分任务,让不同专业 Agent 协同;覆盖更广,但有通信成本与更高开发成本。

能否清晰拆分任务、是否需要不同专长,以及预算与延迟,共同决定架构选择。

09 // COOPERATION

多 Agent 有
四种队形

流水线上一个输出成为下一个输入,适合按顺序交接。
辩论独立分析同一问题,互相审查,再形成共识。
层级领导 Agent 分配任务、监控进度并整合结果。
市场Agent 竞标任务,通过竞争与协作完成工作。

多 Agent 的重点不在“数量”,而在于让协作拓扑匹配任务依赖关系。

10 // EMBODIMENT

大脑与身体之间
需要一座桥

具身智能中,Agent 把“会想”的大脑接到“能做”的身体,并承担安全与反馈。

11 // REAL-WORLD GATE

Agent 进入现实
要过四道关

实时性物理动作需要毫秒级响应,大模型推理常需数百毫秒到数秒。
安全与可靠性物理世界中的错误可能损坏设备,甚至危及人员安全。
多模态融合同时处理视觉、语言、触觉、力觉等多种信息。
Sim-to-Real仿真中可行的策略,迁移到真实环境仍可能出现差距。

从屏幕走向物理世界,实时、安全、融合与迁移都必须成为系统边界。

12 // RECAP

Agent 如何 把想法变行动

01

从“回答”到 “完成任务”

LLM 像聪明的大脑

02

Agent 为什么 需要记忆

上下文让 Agent 记住眼前,向量检索让它按需找回过去。

03

函数调用是 通信协议

Function Calling 让模型用结构化参数调用外部工具。

04

多 Agent 有 四种队形

多 Agent 的重点不在“数量”

05

Agent 进入现实 要过四道关

从屏幕走向物理世界

把任务拆解、工具协议、协作架构与真实反馈连在一起,才是 Agent 的完整能力。

SOURCE QUIZ

单选题
10 题

一、单项选择题(每题 10 分,共 100 分)

得分 0/100 分 · 答对 0/10

先独立作答,再用讲义解析核对自己对机制、架构与边界的理解。

SOURCE PRACTICE 01

实操:旅行规划
ReAct 工作流

二、实操题(每题 50 分,共 100 分)

实操题 1:设计一个"智能旅行规划 Agent"工作流(50 分)

题目描述:

请你设计一个"智能旅行规划 Agent"的完整工作流。用户输入旅行目的地和天数,Agent 需要完成以下任务:

  1. 查询目的地天气
  2. 搜索景点推荐
  3. 规划每日行程安排
  4. 估算旅行预算

要求:

  • 使用 ReAct 模式,至少写出 4 轮 Thought → Action → Observation 的循环
  • 明确标注每一步中 Agent 调用了什么工具(如 search_weathersearch_attractionsplan_itineraryestimate_budget
  • 使用国内大模型平台(如通义千问、文心一言、DeepSeek、Kimi 等)作为 Agent 的大脑

请先独立完成方案,再展开讲义参考答案与评分标准进行核对。

SOURCE PRACTICE 02

实操:代码审查
多 Agent 协作

二、实操题(每题 50 分,共 100 分)

实操题 2:设计一个"代码审查多 Agent 协作系统"(50 分)

题目描述:

某公司需要构建一个自动化的代码审查系统。请设计一个多 Agent 协作架构,要求至少包含 3 个不同职责的 Agent。

要求:

  1. 说明每个 Agent 的职责和分工
  2. 画出 Agent 之间的协作流程(文字描述即可)
  3. 说明多 Agent 相比单 Agent 在这个场景中的优势
  4. 使用国内大模型平台实现

请先独立完成方案,再展开讲义参考答案与评分标准进行核对。