为 AI 应用设计安全边界
模块 9 作业:为 AI 应用设计安全边界
背景
对应学习目标:理解幻觉的原因和缓解方法;解释 Prompt Injection 的基本原理;识别敏感数据、权限和隐私风险;为 AI 应用设计基础安全边界。
这个作业让你把"安全"从口号变成一张可执行的设计。
任务
- 选应用:挑一个 AI 应用场景(客服机器人、写作助手、知识库问答、代码助手任选)。
- 风险识别:针对三类风险各写 2 个该场景下的具体表现:
- 幻觉:哪里可能一本正经地编。
- 注入:哪里可能被用户指令劫持。
- 隐私/权限:哪些数据不该被模型看到。
- 设计防护:为每个风险写一条可落地的防护措施(输入过滤、输出校验、权限隔离、人工审核、日志审计),并说明取舍(防护和体验的代价)。
- 写分级表:给应用的功能按风险分级(低/中/高),每级写明需要的审查强度。
交付物
safety-boundary.md:风险识别、防护设计、风险分级表。
评分 Rubric
| 维度 | 优秀 | 合格 | 需改进 |
|---|---|---|---|
| 风险具体 | 三类风险各 2 个具体场景 | 主要风险覆盖 | 抽象 |
| 防护落地 | 每项防护可执行且有取舍 | 有防护思路 | 无 |
| 风险分级 | 分级清楚、审查强度匹配 | 有分级 | 一刀切 |
建议用时
90 分钟。