面对不断更新的模型榜单,企业更需要的是一套自己的判断方法。本文把模型选型拆成需求界定、能力匹配、成本估算与验证四个环节,给出一份可以直接套用的评估清单。

本文包含

  1. 先界定需求,再看模型
  2. 公开榜单能说明什么、不能说明什么
  3. 能力、成本与响应速度的三角关系
  4. 小规模验证怎么设计
  5. 评估清单与常见误区

先界定需求,再看模型

选型之前先回答三个问题:这个场景要处理的是什么类型的任务、输出错了会带来多大代价、允许多长的等待时间。这三点定下来,候选范围通常就收窄了一大半,剩下的比较才有意义。

常见的顺序错误是先挑模型再找场景。结果往往是能力过剩、成本偏高,或者反过来,选了个便宜的模型却始终达不到业务可用的标准,来回折腾几轮。

公开榜单的分数和实际业务表现经常对不上,原因不在榜单本身,而在于评测任务与业务任务的分布差异。我们把常见的几类企业场景与对应的关注指标做了对照,说明什么情况下应该优先看能力、什么情况下成本与稳定性更重要,并给出一份分环节的评估清单,……

以下内容为付费部分。