学完你将做到

进阶入门实践目标

根据任务选择模型,建立质量、速度和成本之间的判断标准。

开始前,准备这些

  • 已有模型接入方式
  • 一个真实任务和参考答案
  • 能够查看用量

01 建立基准任务

选择高频且结果可比较的任务,固定输入、限制和人工参考答案。

02 固定变量对比

用相同提示词测试不同模型,不同时改变上下文与参数。

03 按维度评分

从准确、遵循、完整、可用程度、耗时与成本评分。

04 形成路由规则

日常整理用快模型,复杂规划与最终审核用强模型。

模型评测记录

下面这份模板可以直接复制,再把其中的内容替换成你的真实任务。

任务:把访谈整理为产品需求。
评分:事实准确 30%,遗漏率 25%,结构 20%,可执行性 15%,耗时成本 10%。
低于 80 分或有关键事实错误时升级模型。

这些地方最容易出错

  • 把模型名称当质量保证
  • 一次测试就下长期结论
  • 忽略速度、成本和稳定性

完成检查

不需要记住所有术语。能做到下面这些,就说明你已经真正掌握了这一课。

  1. 测试输入一致
  2. 至少三轮样本
  3. 保留量化评分
  4. 形成升级规则
记住这三件事

按任务选:不存在万能模型;固定测试:保证比较公平;建立路由:兼顾质量成本

需要查看完整附件或补充说明,可以前往 原始资料 ↗

接下来可以学习