学完你将做到
进阶入门实践目标
根据任务选择模型,建立质量、速度和成本之间的判断标准。
开始前,准备这些
- 已有模型接入方式
- 一个真实任务和参考答案
- 能够查看用量
01 建立基准任务
选择高频且结果可比较的任务,固定输入、限制和人工参考答案。
02 固定变量对比
用相同提示词测试不同模型,不同时改变上下文与参数。
03 按维度评分
从准确、遵循、完整、可用程度、耗时与成本评分。
04 形成路由规则
日常整理用快模型,复杂规划与最终审核用强模型。
模型评测记录
下面这份模板可以直接复制,再把其中的内容替换成你的真实任务。
任务:把访谈整理为产品需求。
评分:事实准确 30%,遗漏率 25%,结构 20%,可执行性 15%,耗时成本 10%。
低于 80 分或有关键事实错误时升级模型。这些地方最容易出错
- 把模型名称当质量保证
- 一次测试就下长期结论
- 忽略速度、成本和稳定性
完成检查
不需要记住所有术语。能做到下面这些,就说明你已经真正掌握了这一课。
- 测试输入一致
- 至少三轮样本
- 保留量化评分
- 形成升级规则
记住这三件事
按任务选:不存在万能模型;固定测试:保证比较公平;建立路由:兼顾质量成本。
需要查看完整附件或补充说明,可以前往 原始资料 ↗。
