CS329Z中文学习站

CS 329Z 中文学习站

材料总目录 按主题大类归类 · 全部 50 篇

按 12 个主题大类浏览全部阅读材料;可用下方按钮按翻译类型与重要度筛选。← 返回课程主页

类型
重要度

01导论与背景 3 篇

材料类型重要度讲次
Agentic 设计模式(一):四种提升 GPT-4 与 GPT-3.5 表现的 AI Agent 策略
"Agentic Design Patterns Part 1: Four AI Agent Strategies That Improve GPT-4 and GPT-3.5 Performance"
全文中译 推荐 第1周 · 课程导论
迈向执行接地的自动化 AI 研究
"Towards Execution-Grounded Automated AI Research"
论文精读 推荐 第1周 · 课程导论
从模型到复合 AI 系统的转变
"The Shift from Models to Compound AI Systems"
全文中译 必读 第1周 · 课程导论

02LLM 与上下文工程 2 篇

材料类型重要度讲次
为 AI Agent 做高效的上下文工程
"Effective Context Engineering for AI Agents"
全文中译 推荐 第2周 · 给开发者的 LLM
构建高效的 AI Agent
"Building Effective Agents"
全文中译 必读 第2周 · 给开发者的 LLM

03检索增强生成 2 篇

材料类型重要度讲次
ColBERT:基于 BERT 上下文化延迟交互的高效段落检索
"ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT"
论文精读 推荐 第2周 · 检索增强生成 RAG
面向知识密集型 NLP 任务的检索增强生成
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
全译对照 必读 第2周 · 检索增强生成 RAG

04工具与框架 2 篇

材料类型重要度讲次
模型上下文协议(MCP)规范(2025-06-18 版)
"Model Context Protocol Specification (Version 2025-06-18)"
全文中译 必读 第3周 · 工具调用与 MCP
DSPy:将声明式语言模型调用编译为自我改进的流水线
"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines"
全译对照 必读 第3周 · 框架与编排

05智能体模式与记忆 5 篇

材料类型重要度讲次
"ReAct:在语言模型中协同推理与行动"
"ReAct: Synergizing Reasoning and Acting in Language Models"
全译对照 必读 第4周 · Agent 设计模式
"Mem0:构建具备可扩展长期记忆的生产级 AI Agent"
"Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory"
论文精读 推荐 第4周 · Agent 记忆
"Agent 记忆:如何构建能学习与记忆的 Agent"
"Agent Memory: How to Build Agents That Learn and Remember"
全文中译 推荐 第4周 · Agent 记忆
"MemGPT:让 LLM 走向操作系统"
"MemGPT: Towards LLMs as Operating Systems"
全译对照 必读 第4周 · Agent 记忆
"生成式 Agent:人类行为的交互式拟真"
"Generative Agents: Interactive Simulacra of Human Behavior"
论文精读 推荐 第4周 · Agent 记忆

06多智能体系统 4 篇

材料类型重要度讲次
"为什么多智能体 LLM 系统会失败?"
"Why Do Multi-Agent LLM Systems Fail?"
全译对照 必读 第5周 · 多智能体系统
"DyLAN:面向任务的动态 LLM 智能体协作网络"
"A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration"
论文精读 补充 第5周 · 多智能体系统
别忽视单智能体系统
Don't Sleep on Single-agent Systems
全文中译 推荐 第5周 · 多智能体系统
"AutoGen:以多智能体对话构建下一代 LLM 应用"
"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation"
论文精读 推荐 第5周 · 多智能体系统

07优化 4 篇

材料类型重要度讲次
"GEPA:反思式提示进化可以胜过强化学习"
"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning"
全译对照 必读 第5周 · 优化:测试时计算与提示优化
为多阶段语言模型程序优化指令与示例(MIPRO / MIPROv2)
Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs
论文精读 推荐 第5周 · 优化:测试时计算与提示优化
"优化地扩展 LLM 测试时计算,可以比扩展模型参数更有效"
"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters"
全译对照 必读 第5周 · 优化:测试时计算与提示优化
"微调与提示优化:单打都不如组合拳(BetterTogether)"
"Fine-Tuning and Prompt Optimization: Two Great Steps that Work Better Together"
论文精读 推荐 第5周 · 优化:测试时计算与提示优化

08数据工程 5 篇

材料类型重要度讲次
LLM 应用的数据飞轮
Data Flywheels for LLM Applications
全文中译 必读 第6周 · 数据
"用于数据标注与合成的 LLM:综述"
"Large Language Models for Data Annotation and Synthesis: A Survey"
论文精读 推荐 第6周 · 数据
"谁来验证验证者?让 LLM 辅助评估与人类偏好对齐"
"Who Validates the Validators? Aligning LLM-Assisted Evaluation of LLM Outputs with Human Preferences"
论文精读 推荐 第7周 · 数据选择与质量
"SWE-smith:为软件工程 Agent 扩展数据规模"
"SWE-smith: Scaling Data for Software Engineering Agents"
论文精读 推荐 第7周 · 数据选择与质量
"LIMA:对齐中的「少即是多」"
"LIMA: Less Is More for Alignment"
全译对照 必读 第7周 · 数据选择与质量

09评测 7 篇

材料类型重要度讲次
"tinyBenchmarks:用更少样本评测大语言模型"
"tinyBenchmarks: evaluating LLMs with fewer examples"
论文精读 推荐 第7周 · 评测基础
"如何构建好的语言建模基准"
"How to Build Good Language Modeling Benchmarks"
全文中译 推荐 第7周 · 评测基础
"构建严谨 Agent 基准的最佳实践"
"Establishing Best Practices for Building Rigorous Agentic Benchmarks"
全译对照 必读 第7周 · 评测基础
"解构 AI Agent 评测"
"Demystifying evals for AI agents"
全文中译 必读 第8周 · LLM-as-Judge
"AutoMetrics:用自动生成的评估器逼近人类判断"
"AutoMetrics: Approximate Human Judgments with Automatically Generated Evaluators"
论文精读 推荐 第8周 · LLM-as-Judge
"评审 LLM-as-a-Judge:MT-Bench 与 Chatbot Arena"
"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena"
全译对照 必读 第8周 · LLM-as-Judge
"AutoLibra:从开放式人类反馈归纳 Agent 评测指标"
"AutoLibra: Agent Metric Induction from Open-Ended Human Feedback"
论文精读 推荐 第8周 · LLM-as-Judge

10安全与护栏 6 篇

材料类型重要度讲次
介绍 Anthropic 的负责任扩展政策
"Introducing Anthropic's Responsible Scaling Policy"
全文中译 推荐 第8周 · 安全与护栏
"智能体化 LLM 是强大的去匿名化工具:Anthropic 访谈数据集参与者的重识别"
"Agentic LLMs as Powerful Deanonymizers: Re-identification of Participants in the Anthropic Interviewer Dataset"
论文精读 推荐 第8周 · 安全与护栏
理解提示注入:一项前沿安全挑战
"Understanding prompt injections: a frontier security challenge"
全文中译 必读 第8周 · 安全与护栏
PrivacyLens:评估语言模型在行动中的隐私规范意识
"PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action"
论文精读 推荐 第8周 · 安全与护栏
"面向 LLM 智能体的上下文化隐私防御(CDI)"
"Contextualized Privacy Defense for LLM Agents"
论文精读 推荐 第8周 · 安全与护栏
"通过仿真搜索 LLM 智能体的隐私风险"
"Searching for Privacy Risks in LLM Agents via Simulation"
全译对照 必读 第8周 · 安全与护栏

11编程智能体 5 篇

材料类型重要度讲次
Claude Code 最佳实践
Best practices for Claude Code
全文中译 必读 第9周 · 编程智能体
"SWE-bench:语言模型能解决真实世界的 GitHub Issue 吗?"
"SWE-bench: Can Language Models Resolve Real-World Github Issues?"
全译对照 必读 第9周 · 编程智能体
"OpenHands:AI 软件开发者通用智能体的开放平台"
"OpenHands: An Open Platform for AI Software Developers as Generalist Agents"
论文精读 推荐 第9周 · 编程智能体
"SWE-agent:智能体-计算机接口(ACI)实现自动化软件工程"
"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering"
全译对照 必读 第9周 · 编程智能体
"长时运行智能体的高效 Harness 设计"
"Effective harnesses for long-running agents"
全文中译 推荐 第9周 · 编程智能体

12前沿与开放问题 4 篇

材料类型重要度讲次
从计算机使用中构建通用用户模型
"Creating General User Models from Computer Use"
全译对照 必读 第11周 · 主动式智能体
从人机交互中学习下一动作预测器
"Learning Next Action Predictors from Human-Computer Interaction"
论文精读 推荐 第11周 · 主动式智能体
"OSWorld:在真实计算机环境中评测多模态智能体的开放式任务能力"
"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments"
论文精读 推荐 第11周 · 开放问题
"WebShop:面向可扩展真实网页交互的接地语言智能体"
"WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents"
论文精读 推荐 第11周 · 开放问题

✦背景阅读

材料类型重要度讲次
年薪 85 万美元的绝活,斯坦福免费公开了——为什么值得学这门课全文中译推荐背景阅读