For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主导航

模型选择

选择兼顾性能与成本的最佳模型。

选择合适的模型,无论是 gpt-6-astra,还是 gpt-5.6-terra 这样较小的模型,都需要平衡 准确性延迟成本。本指南将介绍关键原则,并结合实际示例,帮助您做出有依据的选择。

核心原则

模型选择的原则很简单:

  • 先优化准确性: 持续优化,直到达到您的准确性目标。
  • 再优化成本和延迟: 在保持准确性的前提下,尽可能采用成本最低、速度最快的模型。

1. 优先关注准确性

首先,为您的用例设定明确的准确性目标,确定达到什么水平才算“足够好”,可以投入生产环境。您可以通过以下步骤来实现:

  • 设定明确的准确性目标: 确定您要达到的准确性统计指标。
    • 例如,90% 的客服来电需要在首次交互时得到正确分流。
  • 构建评估数据集: 创建一个数据集,用于衡量模型是否达到这些目标。
    • 继续上面的示例,收集 100 个交互样例,记录用户的请求、LLM 将其分流到哪里、正确的分流结果应该是什么,以及实际分流是否正确。
  • 使用最强大的模型进行优化: 先使用当前能力最强的模型来实现您的准确性目标。记录所有响应,以便之后利用这些数据蒸馏出较小的模型。
    • 使用检索增强生成来优化准确性
    • 使用微调来优化一致性和行为

在此过程中,收集成对的提示和补全内容,用于评估、少样本学习或微调。这种做法称为 提示烘焙,有助于生成高质量样例,供以后使用。

有关更多相关方法和工具,请参阅我们的准确性优化指南

设定切合实际的准确性目标

评估模型决策带来的经济影响,据此计算切合实际的准确性目标。例如,在虚假新闻分类场景中:

  • 新闻分类正确: 如果模型分类正确,就能为您节省人工审查的费用,假设这笔费用为 $50
  • 新闻分类错误: 如果模型将一篇正常文章误判为虚假新闻,或漏掉一篇虚假新闻,就可能触发审查流程,甚至引发投诉,这可能会产生 $300 的费用。

在这个新闻分类示例中,准确率需要达到 85.8% 才能覆盖成本,因此将目标设为 90% 或更高,可以确保整体上获得投资回报。请根据您具体的成本结构,通过此类计算设定合理的准确性目标。

2. 优化成本和延迟

成本和延迟之所以放在次要位置,是因为如果模型无法达到您的准确性目标,讨论这些就没有意义。不过,一旦找到适合您用例的模型,就可以采用以下两种方法之一:

  • 与较小模型的零样本或少样本表现进行比较: 换用更小、成本更低的模型,测试它是否能在降低成本和延迟的同时保持准确性。
  • 模型蒸馏: 使用准确性优化过程中收集的数据,对较小的模型进行微调。

成本和延迟通常相互关联;减少 Token 数量和请求次数,一般也能加快处理速度。

这里主要可以考虑以下策略:

  • 减少请求: 减少完成任务所需的请求次数。
  • 尽量减少 Token: 减少输入 Token 数量,并通过优化缩短模型输出。
  • 选择较小的模型: 使用能够兼顾降低成本和延迟、保持准确性的模型。

如需深入了解这些策略,请参阅我们的延迟优化指南。

例外情况

这些原则也有明确的例外。如果您的用例对成本或延迟极为敏感,请在开始测试前为这些指标设定阈值,然后排除超出阈值的模型。确定衡量标准后,这些指导原则将帮助您在约束范围内提高模型的准确性。

实际示例

为演示这些原则,我们将开发一个虚假新闻分类器,并设定以下目标指标。下面的实验使用 GPT-4o 系列的历史结果来展示工作流程;如果您现在开展评估,请先使用 gpt-6-astra,再与较小的模型或经过微调的模型进行比较。

  • 准确率: 分类正确率达到 90%
  • 成本: 每 1,000 篇文章的费用低于 $5
  • 延迟: 每篇文章的处理时间保持在 2 秒以内

实验

为实现目标,我们进行了三次实验:

  1. 零样本: 使用 GPT-4o 和一个基础提示处理 1,000 条记录,但未达到准确率目标。
  2. 少样本学习: 加入 5 个少样本示例后,达到了准确率目标,但提示中的 Token 增多,导致成本超出目标。
  3. 微调模型: 使用 1,000 个带标签的样例对 GPT-4o-mini 进行微调,在延迟和准确率相近的情况下大幅降低了成本,达到了所有目标。
编号方法准确率准确率目标成本成本目标平均延迟延迟目标
1gpt-4o 零样本84.5%$1.72< 1s
2gpt-4o 少样本(n=5)91.5%$11.92< 1s
3使用 1000 个示例微调的 gpt-4o-mini91.5%$0.21< 1s

结论

我们仅使用 1,000 个标注示例进行微调,并将 gpt-4o 换为 gpt-4o-mini,就以 不到原来 2% 的成本实现了同等性能

这个过程很重要。通常,您无法直接从微调开始,因为您还不确定微调是否适合所需的优化,或者没有足够的标注示例。先使用 gpt-6-astra 确定准确率目标,然后在需要考虑成本和延迟时,测试更小的模型或经过微调的模型。