AI Agent 课程
Agent = LLM + 上下文 + 工具
从实践出发理解 AI Agent 的设计原理:上下文工程、工具设计、Coding Agent、评估、后训练、自我进化与多 Agent 协作。共 10 章,含引言、后记与思考题参考答案。
开发者只需要定义工具和执行工具调用,模型自主完成“要不要调用、调哪个、传什么参数”的决策。第二章将详细展开这个 API 结构。 在为 Agent 设计工具时,应尽量保持工具的通用性,给 LLM 更大的发挥空间。例如,与其设计一个专用的计算器工具,不如提供一个 Python 代码解释器,并为 Agen……
这个请求只包含两条消息:一条 system(开发者写的规则)和一条 user(用户的输入)。模型返回一条 assistant 消息作为回复。这就是大模型 API 最基本的交互模式——每次调用都是无状态的,所有模型需要的信息必须在请求的消息列表中完整提供。 ### 带工具调用的多轮交互:Agent 的……
这段对话结束后,Agent 框架会调用一次专门的 LLM 来分析对话内容,提取出值得长期记住的信息:
只有当这些维度被清晰地建模为结构化事件,Agent 才能在多方通信中保持清晰的认知,避免将用户输入误当成工具结果,或将藏有指令的工具结果误认为用户指令而导致提示注入。多线程上下文管理的复杂性还要求 Agent 理解多个对话线程之间的关联——来自第三方的消息如何影响用户的情绪,用户在多个对话中的角色转……
整个过程只用了 Grep(搜索内容)和 Write(写文件)两个工具。如果任务更复杂——比如“统计每个模块的 TODO 数量并画个柱状图”——Agent 还会用 Code Interpreter 执行 Python 代码来做统计和绘图。七个工具虽然简单,组合起来就能完成非常多样化的任务。 为什么每个……
注意模型输出的不只是文字转录,还包括语音事件标记(开始/结束说话、情绪变化、沉默间隔)。Agent 框架可以利用这些标记实现更自然的交互——比如检测到用户犹豫时主动提供选项。 > 实验 9-3 ★:使用 Qwen2-Audio 模拟流式语音感知 > > 需要先说明实验设计:Qwen2-Audio 本……
问题在哪?“reasoning”(模型的思考过程)和“inference”(模型的前向推理/部署运行)是两个不同的概念,但因为术语 Agent 一开始把 reasoning 翻译成了“推理”,后续 Agent 在遇到 inference 时也自然选择了同一个词——两个不同概念被合并成了同一个译名,读……