AI Agent 课程 目录

AI Agent 课程

Agent = LLM + 上下文 + 工具

从实践出发理解 AI Agent 的设计原理:上下文工程、工具设计、Coding Agent、评估、后训练、自我进化与多 Agent 协作。共 10 章,含引言、后记与思考题参考答案。

引言✓ 已读
引言

约 0.8 万字 · 20 分钟
第 1 章✓ 已读
AI Agent 入门

开发者只需要定义工具和执行工具调用,模型自主完成“要不要调用、调哪个、传什么参数”的决策。第二章将详细展开这个 API 结构。 在为 Agent 设计工具时,应尽量保持工具的通用性,给 LLM 更大的发挥空间。例如,与其设计一个专用的计算器工具,不如提供一个 Python 代码解释器,并为 Agen……

约 2.7 万字 · 67 分钟
第 2 章✓ 已读
上下文工程

这个请求只包含两条消息:一条 system(开发者写的规则)和一条 user(用户的输入)。模型返回一条 assistant 消息作为回复。这就是大模型 API 最基本的交互模式——每次调用都是无状态的,所有模型需要的信息必须在请求的消息列表中完整提供。 ### 带工具调用的多轮交互:Agent 的……

约 5.7 万字 · 142 分钟
第 3 章✓ 已读
用户记忆和知识库

这段对话结束后,Agent 框架会调用一次专门的 LLM 来分析对话内容,提取出值得长期记住的信息:

约 4.1 万字 · 103 分钟
第 4 章✓ 已读
工具

只有当这些维度被清晰地建模为结构化事件,Agent 才能在多方通信中保持清晰的认知,避免将用户输入误当成工具结果,或将藏有指令的工具结果误认为用户指令而导致提示注入。多线程上下文管理的复杂性还要求 Agent 理解多个对话线程之间的关联——来自第三方的消息如何影响用户的情绪,用户在多个对话中的角色转……

约 4.0 万字 · 101 分钟
第 5 章✓ 已读
Coding Agent 与代码生成

整个过程只用了 Grep(搜索内容)和 Write(写文件)两个工具。如果任务更复杂——比如“统计每个模块的 TODO 数量并画个柱状图”——Agent 还会用 Code Interpreter 执行 Python 代码来做统计和绘图。七个工具虽然简单,组合起来就能完成非常多样化的任务。 为什么每个……

约 4.4 万字 · 110 分钟
第 6 章✓ 已读
Agent 的评估

约 3.8 万字 · 96 分钟
第 7 章✓ 已读
模型后训练

约 5.4 万字 · 135 分钟
第 8 章✓ 已读
Agent 的自我进化

约 2.2 万字 · 55 分钟
第 9 章✓ 已读
多模态与实时交互

注意模型输出的不只是文字转录,还包括语音事件标记(开始/结束说话、情绪变化、沉默间隔)。Agent 框架可以利用这些标记实现更自然的交互——比如检测到用户犹豫时主动提供选项。 > 实验 9-3 ★:使用 Qwen2-Audio 模拟流式语音感知 > > 需要先说明实验设计:Qwen2-Audio 本……

约 3.6 万字 · 89 分钟
第 10 章✓ 已读
多 Agent 协作

问题在哪?“reasoning”(模型的思考过程)和“inference”(模型的前向推理/部署运行)是两个不同的概念,但因为术语 Agent 一开始把 reasoning 翻译成了“推理”,后续 Agent 在遇到 inference 时也自然选择了同一个词——两个不同概念被合并成了同一个译名,读……

约 4.7 万字 · 118 分钟
后记✓ 已读
后记:回到 Agent = LLM + 上下文 + 工具

约 0.4 万字 · 11 分钟
附录✓ 已读
思考题参考答案

约 2.3 万字 · 58 分钟