01导论与背景 3 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| Agentic 设计模式(一):四种提升 GPT-4 与 GPT-3.5 表现的 AI Agent 策略 "Agentic Design Patterns Part 1: Four AI Agent Strategies That Improve GPT-4 and GPT-3.5 Performance" |
全文中译 | 推荐 | 第1周 · 课程导论 |
| 迈向执行接地的自动化 AI 研究 "Towards Execution-Grounded Automated AI Research" |
论文精读 | 推荐 | 第1周 · 课程导论 |
| 从模型到复合 AI 系统的转变 "The Shift from Models to Compound AI Systems" |
全文中译 | 必读 | 第1周 · 课程导论 |
02LLM 与上下文工程 2 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| 为 AI Agent 做高效的上下文工程 "Effective Context Engineering for AI Agents" |
全文中译 | 推荐 | 第2周 · 给开发者的 LLM |
| 构建高效的 AI Agent "Building Effective Agents" |
全文中译 | 必读 | 第2周 · 给开发者的 LLM |
03检索增强生成 2 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| ColBERT:基于 BERT 上下文化延迟交互的高效段落检索 "ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT" |
论文精读 | 推荐 | 第2周 · 检索增强生成 RAG |
| 面向知识密集型 NLP 任务的检索增强生成 Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks |
全译对照 | 必读 | 第2周 · 检索增强生成 RAG |
04工具与框架 2 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| 模型上下文协议(MCP)规范(2025-06-18 版) "Model Context Protocol Specification (Version 2025-06-18)" |
全文中译 | 必读 | 第3周 · 工具调用与 MCP |
| DSPy:将声明式语言模型调用编译为自我改进的流水线 "DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines" |
全译对照 | 必读 | 第3周 · 框架与编排 |
05智能体模式与记忆 5 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| "ReAct:在语言模型中协同推理与行动" "ReAct: Synergizing Reasoning and Acting in Language Models" |
全译对照 | 必读 | 第4周 · Agent 设计模式 |
| "Mem0:构建具备可扩展长期记忆的生产级 AI Agent" "Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory" |
论文精读 | 推荐 | 第4周 · Agent 记忆 |
| "Agent 记忆:如何构建能学习与记忆的 Agent" "Agent Memory: How to Build Agents That Learn and Remember" |
全文中译 | 推荐 | 第4周 · Agent 记忆 |
| "MemGPT:让 LLM 走向操作系统" "MemGPT: Towards LLMs as Operating Systems" |
全译对照 | 必读 | 第4周 · Agent 记忆 |
| "生成式 Agent:人类行为的交互式拟真" "Generative Agents: Interactive Simulacra of Human Behavior" |
论文精读 | 推荐 | 第4周 · Agent 记忆 |
06多智能体系统 4 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| "为什么多智能体 LLM 系统会失败?" "Why Do Multi-Agent LLM Systems Fail?" |
全译对照 | 必读 | 第5周 · 多智能体系统 |
| "DyLAN:面向任务的动态 LLM 智能体协作网络" "A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration" |
论文精读 | 补充 | 第5周 · 多智能体系统 |
| 别忽视单智能体系统 Don't Sleep on Single-agent Systems |
全文中译 | 推荐 | 第5周 · 多智能体系统 |
| "AutoGen:以多智能体对话构建下一代 LLM 应用" "AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation" |
论文精读 | 推荐 | 第5周 · 多智能体系统 |
07优化 4 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| "GEPA:反思式提示进化可以胜过强化学习" "GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning" |
全译对照 | 必读 | 第5周 · 优化:测试时计算与提示优化 |
| 为多阶段语言模型程序优化指令与示例(MIPRO / MIPROv2) Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs |
论文精读 | 推荐 | 第5周 · 优化:测试时计算与提示优化 |
| "优化地扩展 LLM 测试时计算,可以比扩展模型参数更有效" "Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters" |
全译对照 | 必读 | 第5周 · 优化:测试时计算与提示优化 |
| "微调与提示优化:单打都不如组合拳(BetterTogether)" "Fine-Tuning and Prompt Optimization: Two Great Steps that Work Better Together" |
论文精读 | 推荐 | 第5周 · 优化:测试时计算与提示优化 |
08数据工程 5 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| LLM 应用的数据飞轮 Data Flywheels for LLM Applications |
全文中译 | 必读 | 第6周 · 数据 |
| "用于数据标注与合成的 LLM:综述" "Large Language Models for Data Annotation and Synthesis: A Survey" |
论文精读 | 推荐 | 第6周 · 数据 |
| "谁来验证验证者?让 LLM 辅助评估与人类偏好对齐" "Who Validates the Validators? Aligning LLM-Assisted Evaluation of LLM Outputs with Human Preferences" |
论文精读 | 推荐 | 第7周 · 数据选择与质量 |
| "SWE-smith:为软件工程 Agent 扩展数据规模" "SWE-smith: Scaling Data for Software Engineering Agents" |
论文精读 | 推荐 | 第7周 · 数据选择与质量 |
| "LIMA:对齐中的「少即是多」" "LIMA: Less Is More for Alignment" |
全译对照 | 必读 | 第7周 · 数据选择与质量 |
09评测 7 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| "tinyBenchmarks:用更少样本评测大语言模型" "tinyBenchmarks: evaluating LLMs with fewer examples" |
论文精读 | 推荐 | 第7周 · 评测基础 |
| "如何构建好的语言建模基准" "How to Build Good Language Modeling Benchmarks" |
全文中译 | 推荐 | 第7周 · 评测基础 |
| "构建严谨 Agent 基准的最佳实践" "Establishing Best Practices for Building Rigorous Agentic Benchmarks" |
全译对照 | 必读 | 第7周 · 评测基础 |
| "解构 AI Agent 评测" "Demystifying evals for AI agents" |
全文中译 | 必读 | 第8周 · LLM-as-Judge |
| "AutoMetrics:用自动生成的评估器逼近人类判断" "AutoMetrics: Approximate Human Judgments with Automatically Generated Evaluators" |
论文精读 | 推荐 | 第8周 · LLM-as-Judge |
| "评审 LLM-as-a-Judge:MT-Bench 与 Chatbot Arena" "Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena" |
全译对照 | 必读 | 第8周 · LLM-as-Judge |
| "AutoLibra:从开放式人类反馈归纳 Agent 评测指标" "AutoLibra: Agent Metric Induction from Open-Ended Human Feedback" |
论文精读 | 推荐 | 第8周 · LLM-as-Judge |
10安全与护栏 6 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| 介绍 Anthropic 的负责任扩展政策 "Introducing Anthropic's Responsible Scaling Policy" |
全文中译 | 推荐 | 第8周 · 安全与护栏 |
| "智能体化 LLM 是强大的去匿名化工具:Anthropic 访谈数据集参与者的重识别" "Agentic LLMs as Powerful Deanonymizers: Re-identification of Participants in the Anthropic Interviewer Dataset" |
论文精读 | 推荐 | 第8周 · 安全与护栏 |
| 理解提示注入:一项前沿安全挑战 "Understanding prompt injections: a frontier security challenge" |
全文中译 | 必读 | 第8周 · 安全与护栏 |
| PrivacyLens:评估语言模型在行动中的隐私规范意识 "PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action" |
论文精读 | 推荐 | 第8周 · 安全与护栏 |
| "面向 LLM 智能体的上下文化隐私防御(CDI)" "Contextualized Privacy Defense for LLM Agents" |
论文精读 | 推荐 | 第8周 · 安全与护栏 |
| "通过仿真搜索 LLM 智能体的隐私风险" "Searching for Privacy Risks in LLM Agents via Simulation" |
全译对照 | 必读 | 第8周 · 安全与护栏 |
11编程智能体 5 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| Claude Code 最佳实践 Best practices for Claude Code |
全文中译 | 必读 | 第9周 · 编程智能体 |
| "SWE-bench:语言模型能解决真实世界的 GitHub Issue 吗?" "SWE-bench: Can Language Models Resolve Real-World Github Issues?" |
全译对照 | 必读 | 第9周 · 编程智能体 |
| "OpenHands:AI 软件开发者通用智能体的开放平台" "OpenHands: An Open Platform for AI Software Developers as Generalist Agents" |
论文精读 | 推荐 | 第9周 · 编程智能体 |
| "SWE-agent:智能体-计算机接口(ACI)实现自动化软件工程" "SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering" |
全译对照 | 必读 | 第9周 · 编程智能体 |
| "长时运行智能体的高效 Harness 设计" "Effective harnesses for long-running agents" |
全文中译 | 推荐 | 第9周 · 编程智能体 |
12前沿与开放问题 4 篇
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| 从计算机使用中构建通用用户模型 "Creating General User Models from Computer Use" |
全译对照 | 必读 | 第11周 · 主动式智能体 |
| 从人机交互中学习下一动作预测器 "Learning Next Action Predictors from Human-Computer Interaction" |
论文精读 | 推荐 | 第11周 · 主动式智能体 |
| "OSWorld:在真实计算机环境中评测多模态智能体的开放式任务能力" "OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments" |
论文精读 | 推荐 | 第11周 · 开放问题 |
| "WebShop:面向可扩展真实网页交互的接地语言智能体" "WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents" |
论文精读 | 推荐 | 第11周 · 开放问题 |
✦背景阅读
| 材料 | 类型 | 重要度 | 讲次 |
|---|---|---|---|
| 年薪 85 万美元的绝活,斯坦福免费公开了——为什么值得学这门课 | 全文中译 | 推荐 | 背景阅读 |