课程表与阅读材料 材料总目录 →
📖 论文逐段全译对照进度:14 / 35 篇已完成——完成篇带 全译对照 徽章(正文每段英文原文+中文全译,页内可切换仅看中文);其余论文暂为 论文精读(逐章精读笔记),博客类为 全文中译。全译对照持续更新中。
01
导论与背景
课程定位、复合 AI 系统与智能体设计模式总览 · 共 3 篇
9/23
课程导论 第1周
3 篇材料
-
推荐
全文中译
Agentic 设计模式(一):四种提升 GPT-4 与 GPT-3.5 表现的 AI Agent 策略
"Agentic Design Patterns Part 1: Four AI Agent Strategies That Improve GPT-4 and GPT-3.5 Performance"吴恩达提出反思、工具使用、规划、多智能体协作四大 Agentic 设计模式,并指出迭代式 Agent 工作流的提升远超模型换代。
-
推荐
论文精读
迈向执行接地的自动化 AI 研究
"Towards Execution-Grounded Automated AI Research"斯坦福团队构建自动化想法执行器,用进化搜索与 RL 从执行反馈中学习,发现搜索高效而 RL 因多样性坍缩难以提升上界。
-
必读
全文中译
从模型到复合 AI 系统的转变
"The Shift from Models to Compound AI Systems"伯克利 BAIR 博客指出最先进 AI 结果越来越来自多组件复合系统而非单一模型,并分析其动因、设计挑战与新兴工具范式。
02
LLM 与上下文工程
给开发者的 LLM 使用之道与上下文工程 · 共 2 篇
9/28
给开发者的 LLM 第2周
2 篇材料
-
推荐
全文中译
为 AI Agent 做高效的上下文工程
"Effective Context Engineering for AI Agents"Anthropic 提出「上下文工程」是提示工程的演进:上下文是有限资源,需为 Agent 策展最小高信号 token 集合并配合检索、压缩与记忆。
-
必读
全文中译
构建高效的 AI Agent
"Building Effective Agents"Anthropic 基于数十个客户项目的经验,总结增强型 LLM、五种工作流与自主 Agent 等可组合模式,主张从最简单方案做起。
03
检索增强生成
RAG 范式与稠密段落检索 · 共 2 篇
9/30
检索增强生成 RAG 第2周
2 篇材料
-
推荐
论文精读
ColBERT:基于 BERT 上下文化延迟交互的高效段落检索
"ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT"提出"延迟交互"范式:查询与文档各自编码为 token 级嵌入后用 MaxSim 聚合打分,以 BERT 级效果换来数量级更低的延迟,并支持端到端检索。
-
必读
全译对照
面向知识密集型 NLP 任务的检索增强生成
Retrieval-Augmented Generation for Knowledge-Intensive NLP TasksRAG 开山之作:把预训练 seq2seq 生成器与 DPR 神经检索器端到端联合微调,在开放域问答等知识密集型任务上刷新纪录。
04
工具与框架
MCP 协议规范与 DSPy 编程模型 · 共 2 篇
10/5
工具调用与 MCP 第3周
1 篇材料
-
必读
全文中译
模型上下文协议(MCP)规范(2025-06-18 版)
"Model Context Protocol Specification (Version 2025-06-18)"MCP 官方规范概览页全文中译:开放协议以 JSON-RPC 2.0 连接 Host/Client/Server 三角色,定义 Server 与 Client 双方能力及安全信任原则。
10/7
框架与编排 第3周
1 篇材料
-
必读
全译对照
DSPy:将声明式语言模型调用编译为自我改进的流水线
"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines"DSPy 把 LM 流水线抽象为文本变换图,用"签名 + 模块 + 优化器"替代手写提示模板,自动编译出超越人工提示工程的系统。
05
智能体模式与记忆
ReAct 范式、MemGPT 与记忆架构 · 共 5 篇
10/12
Agent 设计模式 第4周
1 篇材料
-
必读
全译对照
"ReAct:在语言模型中协同推理与行动"
"ReAct: Synergizing Reasoning and Acting in Language Models"让 LLM 交错生成"思考"与"动作":推理引导行动、行动回馈证据。在 HotpotQA/FEVER 上克服幻觉与错误传播,在 ALFWorld/WebShop 上以 1-2 个示例分别超出模仿/强化学习 34% 与 10%。
10/14
Agent 记忆 第4周
4 篇材料
-
推荐
论文精读
"Mem0:构建具备可扩展长期记忆的生产级 AI Agent"
"Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory"提出 Mem0 及图记忆变体 Mem0g:从对话中动态抽取、整合与检索记忆,在 LOCOMO 上全面领先并大幅降低延迟与 token 开销。
-
推荐
全文中译
"Agent 记忆:如何构建能学习与记忆的 Agent"
"Agent Memory: How to Build Agents That Learn and Remember"Letta 团队系统讲解 Agent 记忆的分类(消息缓冲、核心/召回/归档记忆)与构建技术,并给出"记忆即上下文工程"的统一视角。
-
必读
全译对照
"MemGPT:让 LLM 走向操作系统"
"MemGPT: Towards LLMs as Operating Systems"借鉴操作系统虚拟内存与分层存储思想,为固定上下文 LLM 构建可自我管理的记忆层级,实现长对话与长文档分析。
-
推荐
论文精读
"生成式 Agent:人类行为的交互式拟真"
"Generative Agents: Interactive Simulacra of Human Behavior"斯坦福小镇论文:以记忆流、检索、反思与规划架构驱动 25 个 LLM Agent 模拟可信人类行为,并涌现信息扩散与协作等社会动态。
06
多智能体系统
协作框架、失败分析与动态团队 · 共 4 篇
10/19
多智能体系统 第5周
4 篇材料
-
必读
全译对照
"为什么多智能体 LLM 系统会失败?"
"Why Do Multi-Agent LLM Systems Fail?"首个多智能体失败分类法 MAST:14 种失败模式归入 3 大类,基于 1642 条标注轨迹,揭示 MAS 失败多源于系统设计而非模型本身。
-
补充
论文精读
"DyLAN:面向任务的动态 LLM 智能体协作网络"
"A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration"把多智能体协作建模为时序前馈网络(T-FFN):先用"智能体重要性分数"无监督选出任务适配的精英团队,再让团队在动态通信结构(LLM 排序器中途淘汰低效智能体+拜占庭式早停)中协作,四类任务全面超越基线。
-
推荐
全文中译
别忽视单智能体系统
Don't Sleep on Single-agent SystemsOpenHands 作者为"单智能体系统"辩护:多数多智能体系统的收益可以用一个强 LLM、一个统一动作空间和一套好提示实现,复杂度未必是好事。
-
推荐
论文精读
"AutoGen:以多智能体对话构建下一代 LLM 应用"
"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation"微软开源的多智能体对话框架:可对话、可定制的智能体(LLM/人/工具混合后端)+ 对话编程范式,六个应用展示其在数学、RAG、决策、编码等任务上开箱即用的竞争力。
07
优化
测试时计算扩展与提示优化 · 共 4 篇
10/21
优化:测试时计算与提示优化 第5周
4 篇材料
-
必读
全译对照
"GEPA:反思式提示进化可以胜过强化学习"
"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning"用自然语言反思替代标量奖励的策略梯度:GEPA 对复合 AI 系统的提示做反思式进化 + 帕累托候选选择,以最多 35 倍少的 rollout 平均超出 GRPO 6%,并在全部基准上超越 MIPROv2。
-
推荐
论文精读
为多阶段语言模型程序优化指令与示例(MIPRO / MIPROv2)
Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs把 LM 程序的提示优化分解为"提议"与"信用分配"两大挑战,提出 MIPRO 优化器联合优化各模块指令与自举少样本示例,7 个任务中 5 个上取得最佳,并给出 5 条实践 lesson。
-
必读
全译对照
"优化地扩展 LLM 测试时计算,可以比扩展模型参数更有效"
"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters"两种扩展测试时计算的机制(对 PRM 搜索、迭代修订)的有效性关键取决于题目难度;按难度自适应分配算力的"计算最优"策略可用 4 倍少算力超 best-of-N,FLOPs 对齐下胜过 14 倍大模型。
-
推荐
论文精读
"微调与提示优化:单打都不如组合拳(BetterTogether)"
"Fine-Tuning and Prompt Optimization: Two Great Steps that Work Better Together"首次提出交替进行提示优化与权重微调来优化 LM 流水线:同一模型"自己教自己",在 3 任务 × 3 模型上,联合策略平均比仅优化权重/提示分别高出最多 60% 与 6%。
08
数据工程
数据飞轮、标注合成与数据选择 · 共 5 篇
10/28
数据 第6周
2 篇材料
-
必读
全文中译
LLM 应用的数据飞轮
Data Flywheels for LLM Applications提出用生产数据持续改进 LLM 应用的"评估—监控—持续改进"三段式飞轮框架:定义二值指标、动态少样本对齐裁判、把修复过的线上轨迹喂回提示。
-
推荐
论文精读
"用于数据标注与合成的 LLM:综述"
"Large Language Models for Data Annotation and Synthesis: A Survey"系统梳理 LLM 做数据标注/合成的三大环节——标注生成(指令/标签/理由/成对/文本反馈)、标注评估与过滤、标注利用(SFT/对齐/推理),并讨论模型坍塌、幻觉、伦理等挑战。
11/2
数据选择与质量 第7周
3 篇材料
-
推荐
论文精读
"谁来验证验证者?让 LLM 辅助评估与人类偏好对齐"
"Who Validates the Validators? Aligning LLM-Assisted Evaluation of LLM Outputs with Human Preferences"提出 EvalGen 混合主动式界面,让用户在生成评估标准与断言的同时打分,发现「标准漂移」现象:评估标准依赖具体模型输出、随打分不断演变。
-
推荐
论文精读
"SWE-smith:为软件工程 Agent 扩展数据规模"
"SWE-smith: Scaling Data for Software Engineering Agents"通过向真实代码库注入合成 bug 并以单元测试验证,SWE-smith 用约 20 小时人力构建 5 万实例训练集,训练出 SWE-bench Verified 40.2% 的开源 SOTA 模型。
-
必读
全译对照
"LIMA:对齐中的「少即是多」"
"LIMA: Less Is More for Alignment"仅用 1,000 条精心筛选的提示-回复数据微调 LLaMa 65B,不依赖 RLHF,即可与 GPT-4 等强模型竞争,证明对齐主要是学习输出格式而非知识。
09
评测
基准设计原则与 LLM-as-Judge · 共 7 篇
11/4
评测基础 第7周
3 篇材料
-
推荐
论文精读
"tinyBenchmarks:用更少样本评测大语言模型"
"tinyBenchmarks: evaluating LLMs with fewer examples"借鉴心理测量学的项目反应理论(IRT),从 MMLU 等 1.4 万级基准中精选 100 题,即可把 LLM 性能估计误差控制在约 2%,评测成本降低两个数量级。
-
推荐
全文中译
"如何构建好的语言建模基准"
"How to Build Good Language Modeling Benchmarks"SWE-bench 作者 Ofir Press 的基准设计经验谈:好基准应自然、可自动评测、有挑战,并附单一指标、强基线、任务数量等实操准则。
-
必读
全译对照
"构建严谨 Agent 基准的最佳实践"
"Establishing Best Practices for Building Rigorous Agentic Benchmarks"提出 Agent 基准检查清单 ABC,从任务有效性与结果有效性审计十大流行 Agent 基准,发现可致最高 100% 相对误差的缺陷,并用 CVE-Bench 示范修复使高估下降 33%。
11/9
LLM-as-Judge 第8周
4 篇材料
-
必读
全文中译
"解构 AI Agent 评测"
"Demystifying evals for AI agents""Anthropic 评测工程长文:系统讲解 Agent 评测的构成(任务/试验/评分器/轨迹/harness)、三类评分器、pass@k 与 pass^k,以及从零到一搭建可信评测的八步路线图。"
-
推荐
论文精读
"AutoMetrics:用自动生成的评估器逼近人类判断"
"AutoMetrics: Approximate Human Judgments with Automatically Generated Evaluators""提出 AutoMetrics 框架:以少于 100 条人类反馈为输入,自动生成并从 48 个指标的 MetricBank 中检索候选,经 PLS 回归合成与人类判断高相关(最高提升 33.4% Kendall τ)的可解释指标,并可充当代理奖励。"
-
必读
全译对照
"评审 LLM-as-a-Judge:MT-Bench 与 Chatbot Arena"
"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena""LLM-as-a-Judge 开山之作:提出 MT-Bench 与 Chatbot Arena 两大基准,系统研究 GPT-4 评审与人类偏好超 80% 的一致性,并分析位置、冗长、自我增强等偏差及缓解手段。"
-
推荐
论文精读
"AutoLibra:从开放式人类反馈归纳 Agent 评测指标"
"AutoLibra: Agent Metric Induction from Open-Ended Human Feedback""提出 AutoLibra:把「按钮禁用就别再点」这类开放式人类反馈落地到轨迹行为、聚类归纳为可解释指标,并以覆盖度/冗余度两个元指标自动优化,可反哺提示优化使 Agent 成功率提升 20% 以上。"
10
安全与护栏
隐私、提示注入与攻防搜索 · 共 6 篇
11/11
安全与护栏 第8周
6 篇材料
-
推荐
全文中译
介绍 Anthropic 的负责任扩展政策
"Introducing Anthropic's Responsible Scaling Policy"Anthropic 发布负责任扩展政策 RSP,以仿照生物安全等级的 ASL 框架要求模型能力越高、安全证明越严格,把灾难性风险管理嵌入训练与部署决策。
-
推荐
论文精读
"智能体化 LLM 是强大的去匿名化工具:Anthropic 访谈数据集参与者的重识别"
"Agentic LLMs as Powerful Deanonymizers: Re-identification of Participants in the Anthropic Interviewer Dataset"用带网络搜索的 LLM 智能体,仅凭访谈中对研究项目的自然语言描述就匹配出对应论文,24 篇访谈中 6 篇被成功重识别(含唯一确定身份),单次攻击成本不到 0.5 美元。
-
必读
全文中译
理解提示注入:一项前沿安全挑战
"Understanding prompt injections: a frontier security challenge"OpenAI 官方科普提示注入:攻击者借网页、邮件等第三方内容诱导 AI 越权行事,并给出多层防御与用户自护指南。
-
推荐
论文精读
PrivacyLens:评估语言模型在行动中的隐私规范意识
"PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action"以上下文完整性理论为骨架,把隐私敏感种子扩展为情境、轨迹并评测 LM Agent 行为,发现 GPT-4 仍在 25.68% 的案例中泄露隐私。
-
推荐
论文精读
"面向 LLM 智能体的上下文化隐私防御(CDI)"
"Contextualized Privacy Defense for LLM Agents"提出 CDI 防御范式:轻量 instructor 模型在每步动作前生成上下文感知的隐私指引(而非静态提示或事后拦截),并用"失败轨迹即 RL 环境"的经验驱动优化(GRPO)训练,隐私保持 94.2%、有用性 80.6%。
-
必读
全译对照
"通过仿真搜索 LLM 智能体的隐私风险"
"Searching for Privacy Risks in LLM Agents via Simulation"把"隐私风险发现"当搜索问题:三智能体仿真中交替搜索攻击与防御指令,发现伪造同意、多轮冒充等攻击与身份验证状态机防御,可跨模型跨场景迁移;单次攻击 <0.5 美元。
11
编程智能体
SWE 基准、ACI 接口与智能体平台 · 共 5 篇
11/18
编程智能体 第9周
5 篇材料
-
必读
全文中译
Claude Code 最佳实践
Best practices for Claude CodeAnthropic 官方总结的 Claude Code 使用最佳实践:从环境配置、验证闭环、上下文管理到并行扩展的完整工程方法论。
-
必读
全译对照
"SWE-bench:语言模型能解决真实世界的 GitHub Issue 吗?"
"SWE-bench: Can Language Models Resolve Real-World Github Issues?"从 12 个流行 Python 仓库的 9 万个 PR 中筛出 2294 个"真实 issue + 测试验证"任务;发布时最强模型 Claude 2 仅解决 1.96%——编程智能体时代的标志性基准。
-
推荐
论文精读
"OpenHands:AI 软件开发者通用智能体的开放平台"
"OpenHands: An Open Platform for AI Software Developers as Generalist Agents"开源智能体开发平台(前 OpenDevin):事件流架构 + Docker 沙箱运行时 + 代码即动作(CodeAct)+ AgentSkills 工具库 + 多智能体委派,同一 CodeAct 智能体在软件工程、网页、辅助任务 15 个基准上零改动的通用表现。
-
必读
全译对照
"SWE-agent:智能体-计算机接口(ACI)实现自动化软件工程"
"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering"提出"智能体-计算机接口(ACI)"概念:为 LLM 专门设计的搜索/查看/编辑命令 + lint 护栏 + 上下文管理,让 GPT-4 Turbo 在 SWE-bench 上从 3.8% 跃升至 12.47%,不改模型权重。
-
推荐
全文中译
"长时运行智能体的高效 Harness 设计"
"Effective harnesses for long-running agents"Anthropic 工程实践:让智能体跨多个上下文窗口持续数小时工作——初始化智能体(建特性清单/init 脚本/进度文件)+ 编码智能体(每次只做一个特性、留下干净状态、像人类一样端到端测试)。
12
前沿与开放问题
主动式智能体与真实世界环境基准 · 共 4 篇
11/30
主动式智能体 第11周
2 篇材料
-
必读
全译对照
从计算机使用中构建通用用户模型
"Creating General User Models from Computer Use"提出 GUM 架构,从任意非结构化计算机交互(如截图)中推断带置信度的自然语言命题来表示用户,并用主动式助手 Gumbo 展示其应用。
-
推荐
论文精读
从人机交互中学习下一动作预测器
"Learning Next Action Predictors from Human-Computer Interaction"形式化"下一动作预测(NAP)"任务,发布被动标注流水线 NAPsack(20 用户、1800 小时、36 万动作),并提出用 GRPO 端到端训练的 LongNAP 模型。
12/2
开放问题 第11周
2 篇材料
-
推荐
论文精读
"OSWorld:在真实计算机环境中评测多模态智能体的开放式任务能力"
"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments"首个可扩展的真实计算机环境基准:369 个跨应用真实任务、可复现初始状态与执行式评估脚本;人类完成 72.36%,最强模型仅 12.24%。
-
推荐
论文精读
"WebShop:面向可扩展真实网页交互的接地语言智能体"
"WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents"构建含 118 万真实商品、1.2 万众包指令的模拟电商环境;IL+RL 智能体成功率 29%,远低于人类专家 59.6%,并可零样本迁移到真实购物网站。
✦
为什么值得学这门课 背景阅读
1 篇材料
-
推荐
全文中译
"年薪 85 万美元的绝活,斯坦福免费公开了——为什么值得学这门课"
"Stanford Just Put an $850K/Year Skill on YouTube for Free"Anthropic 为能构建自我进化型 AI 智能体的工程师开出最高 85 万美元年薪;斯坦福把教这门手艺的 CS329A 课程完整免费公开。本文是这门课为什么值钱的最好注脚。
课程重要日期
| 周次 | 事项 | 日期 |
|---|---|---|
| 第3周 | HW1《Build an Agentic Harness》发布 | 10/5 |
| 第3周 | Project Proposal 截止 | 10/9 |
| 第6周 | HW2《Evaluate an Agent》发布 · HW1 截止 | 10/26 · 10/30 |
| 第7周 | 期中演示 · 期中报告截止 | 11/4 · 11/6 |
| 第8周 | 论文视频截止 | 11/13 |
| 第9周 | HW2 截止 | 11/20 |
| 第11周 | 互评截止(3 个视频) | 11/30 |
| 期末周 | 最终提交与系统演示 | 12/7–11 |
关于本站
- 翻译策略:论文(PDF)提供逐章精读笔记——摘要(Abstract)全文翻译,方法、实验与结论逐节详细展开并保留关键数字;博客与规范文档(如 MCP 规范、Anthropic 工程博客)提供全文中译。
- 重要度标记:🔴 必读 = 该讲核心;🟡 推荐 = 强烈建议;⚪ 补充 = 拓展阅读。此为编者根据课程大纲的判断,仅供参考。
- 原文:每篇页面顶部有"查看原文"链接,PDF/HTML 原件已收录在本站
originals/目录,可在线打开。 - 时效说明:材料下载于 2026-09-14(开课前),官网后续发布的讲义/幻灯片/作业不在本站范围内。
- 版权:所有原文版权归原作者及机构所有,译文仅供个人学习研究使用。