LLMStart|持续课程 · 不追玄学
模块作业模块 7

模型选型决策表与小型评测集

模块 7 作业:模型选型决策表与小型评测集

背景

对应学习目标:根据任务类型选择模型;设计小型任务评测集;区分人工评测、自动评测和线上监控;估算模型成本、延迟和吞吐压力。

这个作业让你在"排行榜截图"之外,建立自己的选型与评估方法。

任务

  1. 定义任务:写 3 个具体任务(如"中文客服回复""代码审查建议""论文摘要"),每个任务写明输入、输出、质量要求。
  2. 做选型表:对每个任务列一张表:
    • 候选模型(通用/推理/代码/多模态各至少一个)。
    • 权衡维度:质量、成本(Token)、延迟、上下文、隐私、部署方式。
    • 初步结论与理由。
  3. 设计评测集:为其中 1 个任务设计 10 条评测用例(覆盖正常、边界、易错三类),并说明每条测什么。
  4. 写评估流程:说明你会怎么做人工评估 + 自动评估 + 上线后监控。

交付物

  • model-selection.md:3 个任务的选型表与结论。
  • eval-set.md:10 条评测用例 + 评估流程。

评分 Rubric

维度 优秀 合格 需改进
权衡维度 质量/成本/延迟/隐私都覆盖 主要维度覆盖 只看质量
评测集 覆盖三类用例且可执行 基本可用 随意凑数
评估流程 离线/自动/线上三层都有 有基本方案 只有"看效果"

建议用时

120 分钟。