LLMStart|持续课程 · 不追玄学

工作坊 03:Agent 课程研究助手小项目

工作坊 03:Agent 课程研究助手小项目

项目定位

这是 Agent 与工具调用模块的第一个实战工作坊。

目标不是做一个“什么都能干”的万能 Agent,而是做一个范围清楚、工具有限、步骤可检查的课程研究助手。

它用于帮助课程团队完成一个小任务:

把一个 AI 主题整理成课程选题研究笔记。

适合人群

  • 已学完模块 3、模块 5、模块 7、模块 9 的学习者。
  • 希望理解 Agent 如何调用工具、维护状态和处理失败的人。
  • 产品经理可以完成产品设计版。
  • 开发者可以完成代码原型版。

项目目标

完成一个“课程研究助手”原型。

它应该能:

  • 接收一个研究主题。
  • 把主题拆成子问题。
  • 调用有限工具收集资料或整理已有资料。
  • 生成研究笔记。
  • 标注事实、观点、推断和未知。
  • 列出需要人工核查的内容。
  • 输出可转化为课程单元或公众号选题的建议。

第一版范围

第一版只处理

  • 单个 AI 主题。
  • 文本资料。
  • 固定工具集合。
  • 明确状态流转。
  • 研究笔记生成。
  • 人工确认后进入下一步。

第一版不处理

  • 自动发布文章。
  • 自动改动课程正文。
  • 无限制联网搜索。
  • 自动发送邮件或消息。
  • 多用户权限系统。
  • 长期记忆系统。
  • 生产级部署。

Agent 小项目第一版要克制。刚开始就想让它“自主完成全部内容生产”,那不是项目,是许愿池。

使用场景

输入:

研究主题:AI Agent 在企业知识管理中的应用
目标:判断它是否适合进入课程模块 5 或模块 8

输出:

1. 研究问题
2. 子问题
3. 关键概念
4. 资料摘要
5. 事实 / 观点 / 推断 / 未知
6. 课程价值判断
7. 公众号选题建议
8. 需要人工核查的资料

推荐工作流

接收主题
  ↓
任务分类
  ↓
拆分子问题
  ↓
生成研究计划
  ↓
人类确认计划
  ↓
调用资料工具
  ↓
整理证据
  ↓
生成研究笔记
  ↓
质量检查
  ↓
输出课程和内容建议

关键点:高风险或高变化事实必须进入人工核查,不让 Agent 自己拍板。

状态设计

建议使用以下状态:

状态 说明 下一步
topic_received 已收到研究主题 拆分问题
questions_ready 已生成子问题 人类确认
plan_approved 研究计划已确认 收集资料
sources_collected 资料已整理 生成笔记
draft_ready 研究笔记初稿完成 质量检查
needs_review 存在待核查内容 人工核查
completed 输出完成 归档
blocked 缺资料、权限或问题不清楚 请求补充

状态要记录在日志中,方便复盘。

工具设计

第一版工具保持少而清楚。

产品设计版工具

不写代码,手动模拟这些工具:

工具 输入 输出
search_course 关键词 相关课程文件路径
summarize_source 资料文本 结构化摘要
classify_claims 研究笔记 事实、观点、推断、未知
create_content_ideas 研究结论 课程单元和公众号选题
quality_check 初稿 风险和缺口

代码原型版工具

可实现最小工具:

  • 本地文件搜索。
  • Markdown 摘要。
  • 结构化 JSON 输出。
  • 待核查项写入文件。
  • 研究笔记保存。

不要让第一版工具拥有外部发布、删除文件或修改课程正文的权限。

Agent Prompt 框架

基础系统指令:

你是 LLM 与 AI 课程项目的研究助手。

你的任务是辅助课程团队做主题研究,而不是替代人工判断。

规则:
1. 先拆问题,再收集资料。
2. 区分事实、观点、推断和未知。
3. 对高变化信息标记“需要核查”。
4. 不生成未经来源支持的确定结论。
5. 不自动发布或修改正式课程正文。
6. 输出必须适合课程产品建设。

工具调用约束:

只有当当前步骤需要外部资料或本地课程资料时,才调用工具。
每次调用工具前说明目的。
工具返回内容只能作为资料,不自动成为结论。

研究笔记模板

输出建议使用:

# 研究主题

## 1. 研究问题

## 2. 子问题

## 3. 关键概念

## 4. 资料摘要

## 5. 事实

## 6. 观点

## 7. 推断

## 8. 未知和待核查

## 9. 对课程体系的价值

## 10. 可转化内容

## 11. 下一步

测试任务

准备 5 个测试主题:

编号 主题 预期难点
T1 RAG 和微调的区别 容易过度简化
T2 AI Agent 在企业知识管理中的应用 概念边界容易模糊
T3 多模态模型在课程学习中的应用 需要区分输入输出
T4 模型评估为什么不能只看 Benchmark 需要课程化解释
T5 Prompt Injection 的产品风险 需要安全边界

每个主题都要记录:

  • Agent 计划是否合理。
  • 工具调用是否必要。
  • 输出是否区分事实和推断。
  • 是否列出待核查项。
  • 是否能转化为课程或内容选题。

质量检查

检查维度:

维度 优秀 合格 需改进
任务拆解 子问题清楚、覆盖关键角度 基本可用 问题太散
工具使用 目的明确、次数克制 能完成任务 乱调用或漏调用
证据处理 区分事实、观点、推断、未知 有基本标注 混为一谈
课程价值 能对应课程模块和学习障碍 有选题建议 只做资料摘要
风险控制 高变化事实进入核查 有少量提醒 直接给确定结论
可复现性 状态和日志清楚 有基本记录 很难复盘

失败案例记录

每次失败记录:

字段 内容
测试主题
当前状态
失败表现
可能原因
是否工具问题
是否 Prompt 问题
是否资料不足
修复建议

常见失败:

  • 主题还没定义清楚就开始写结论。
  • 把观点说成事实。
  • 引用不存在或无法核查。
  • 工具调用太多但没有带来新信息。
  • 输出像文章摘要,不像课程研究笔记。
  • 没有标出后续课程入口。

交付物

产品设计版

  • agent-workflow.md:Agent 工作流设计。
  • tool-spec.md:工具说明。
  • prompt.md:系统指令和任务 Prompt。
  • test-topics.md:测试主题。
  • research-note-sample.md:样例研究笔记。
  • evaluation-report.md:评估报告。

代码原型版

  • 主题输入入口。
  • 本地资料搜索工具。
  • 摘要和分类工具。
  • 状态日志。
  • 研究笔记输出。
  • 待核查项输出。
  • README 使用说明。

安全边界

第一版必须遵守:

  • 不自动发布内容。
  • 不自动修改正式课程文件。
  • 不处理真实隐私数据。
  • 不执行删除、付款、发送等动作。
  • 不把 AI 结论当最终事实。
  • 不绕过人工确认。

与课程模块的关系

本项目对应:

  • 3.3 与 LLM 协作的方法
  • 5.1 Agent 基础
  • 5.2 Function Calling / Tool Use
  • 5.3 工作流型 Agent
  • 7.2 评估方法
  • 9.2 Prompt Injection
  • 9.4 政策、伦理与治理
  • 10.4 如何用 AI 做研究

延伸挑战

基础版完成后,可以继续:

  • 增加 RAG 检索课程资料。
  • 增加外部资料核查队列。
  • 增加人工审核界面。
  • 增加选题优先级评分。
  • 增加课程单元大纲生成。
  • 增加多 Agent 分工,但每个 Agent 权限保持清楚。

Takeaway

Agent 小项目的重点不是让 AI 自由发挥,而是让它在清楚的任务、状态、工具和审核规则里做研究辅助。能解释每一步、记录每个状态、标出每个不确定性,才是可用 Agent 的开始。