CS329Z中文学习站

Stanford CS 329Z · Fall 2026 · https://cs329z.stanford.edu/

Engineering AI Agents
AI 智能体工程 · 中文学习站

本站收录该课程全部 50 篇阅读材料(35 篇论文 + 15 篇博客/规范)的中文版:论文提供逐章精读笔记(摘要全译 + 方法与实验详解),博客/规范提供全文中译,全部支持在线阅读,并可跳转原文。

12主题大类
50篇材料
21篇必读
100%中文覆盖

课程表与阅读材料 材料总目录 →

📖 论文逐段全译对照进度:14 / 35 篇已完成——完成篇带 全译对照 徽章(正文每段英文原文+中文全译,页内可切换仅看中文);其余论文暂为 论文精读(逐章精读笔记),博客类为 全文中译。全译对照持续更新中。
01

导论与背景

课程定位、复合 AI 系统与智能体设计模式总览 · 共 3 篇

9/23

课程导论 第1周

3 篇材料
02

LLM 与上下文工程

给开发者的 LLM 使用之道与上下文工程 · 共 2 篇

9/28

给开发者的 LLM 第2周

2 篇材料
03

检索增强生成

RAG 范式与稠密段落检索 · 共 2 篇

9/30

检索增强生成 RAG 第2周

2 篇材料
04

工具与框架

MCP 协议规范与 DSPy 编程模型 · 共 2 篇

10/5

工具调用与 MCP 第3周

1 篇材料
10/7

框架与编排 第3周

1 篇材料
05

智能体模式与记忆

ReAct 范式、MemGPT 与记忆架构 · 共 5 篇

10/12

Agent 设计模式 第4周

1 篇材料
  • 必读 全译对照 "ReAct:在语言模型中协同推理与行动"
    "ReAct: Synergizing Reasoning and Acting in Language Models"
    让 LLM 交错生成"思考"与"动作":推理引导行动、行动回馈证据。在 HotpotQA/FEVER 上克服幻觉与错误传播,在 ALFWorld/WebShop 上以 1-2 个示例分别超出模仿/强化学习 34% 与 10%。
10/14

Agent 记忆 第4周

4 篇材料
06

多智能体系统

协作框架、失败分析与动态团队 · 共 4 篇

10/19

多智能体系统 第5周

4 篇材料
07

优化

测试时计算扩展与提示优化 · 共 4 篇

10/21

优化:测试时计算与提示优化 第5周

4 篇材料
08

数据工程

数据飞轮、标注合成与数据选择 · 共 5 篇

10/28

数据 第6周

2 篇材料
  • 必读 全文中译 LLM 应用的数据飞轮
    Data Flywheels for LLM Applications
    提出用生产数据持续改进 LLM 应用的"评估—监控—持续改进"三段式飞轮框架:定义二值指标、动态少样本对齐裁判、把修复过的线上轨迹喂回提示。
  • 推荐 论文精读 "用于数据标注与合成的 LLM:综述"
    "Large Language Models for Data Annotation and Synthesis: A Survey"
    系统梳理 LLM 做数据标注/合成的三大环节——标注生成(指令/标签/理由/成对/文本反馈)、标注评估与过滤、标注利用(SFT/对齐/推理),并讨论模型坍塌、幻觉、伦理等挑战。
11/2

数据选择与质量 第7周

3 篇材料
09

评测

基准设计原则与 LLM-as-Judge · 共 7 篇

11/4

评测基础 第7周

3 篇材料
11/9

LLM-as-Judge 第8周

4 篇材料
  • 必读 全文中译 "解构 AI Agent 评测"
    "Demystifying evals for AI agents"
    "Anthropic 评测工程长文:系统讲解 Agent 评测的构成(任务/试验/评分器/轨迹/harness)、三类评分器、pass@k 与 pass^k,以及从零到一搭建可信评测的八步路线图。"
  • 推荐 论文精读 "AutoMetrics:用自动生成的评估器逼近人类判断"
    "AutoMetrics: Approximate Human Judgments with Automatically Generated Evaluators"
    "提出 AutoMetrics 框架:以少于 100 条人类反馈为输入,自动生成并从 48 个指标的 MetricBank 中检索候选,经 PLS 回归合成与人类判断高相关(最高提升 33.4% Kendall τ)的可解释指标,并可充当代理奖励。"
  • 必读 全译对照 "评审 LLM-as-a-Judge:MT-Bench 与 Chatbot Arena"
    "Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena"
    "LLM-as-a-Judge 开山之作:提出 MT-Bench 与 Chatbot Arena 两大基准,系统研究 GPT-4 评审与人类偏好超 80% 的一致性,并分析位置、冗长、自我增强等偏差及缓解手段。"
  • 推荐 论文精读 "AutoLibra:从开放式人类反馈归纳 Agent 评测指标"
    "AutoLibra: Agent Metric Induction from Open-Ended Human Feedback"
    "提出 AutoLibra:把「按钮禁用就别再点」这类开放式人类反馈落地到轨迹行为、聚类归纳为可解释指标,并以覆盖度/冗余度两个元指标自动优化,可反哺提示优化使 Agent 成功率提升 20% 以上。"
10

安全与护栏

隐私、提示注入与攻防搜索 · 共 6 篇

11/11

安全与护栏 第8周

6 篇材料
11

编程智能体

SWE 基准、ACI 接口与智能体平台 · 共 5 篇

11/18

编程智能体 第9周

5 篇材料
12

前沿与开放问题

主动式智能体与真实世界环境基准 · 共 4 篇

11/30

主动式智能体 第11周

2 篇材料
12/2

开放问题 第11周

2 篇材料
✦

为什么值得学这门课 背景阅读

1 篇材料

课程重要日期

周次事项日期
第3周HW1《Build an Agentic Harness》发布10/5
第3周Project Proposal 截止10/9
第6周HW2《Evaluate an Agent》发布 · HW1 截止10/26 · 10/30
第7周期中演示 · 期中报告截止11/4 · 11/6
第8周论文视频截止11/13
第9周HW2 截止11/20
第11周互评截止(3 个视频)11/30
期末周最终提交与系统演示12/7–11

关于本站

  • 翻译策略:论文(PDF)提供逐章精读笔记——摘要(Abstract)全文翻译,方法、实验与结论逐节详细展开并保留关键数字;博客与规范文档(如 MCP 规范、Anthropic 工程博客)提供全文中译。
  • 重要度标记:🔴 必读 = 该讲核心;🟡 推荐 = 强烈建议;⚪ 补充 = 拓展阅读。此为编者根据课程大纲的判断,仅供参考。
  • 原文:每篇页面顶部有"查看原文"链接,PDF/HTML 原件已收录在本站 originals/ 目录,可在线打开。
  • 时效说明:材料下载于 2026-09-14(开课前),官网后续发布的讲义/幻灯片/作业不在本站范围内。
  • 版权:所有原文版权归原作者及机构所有,译文仅供个人学习研究使用。