For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主导航

关键概念

使用 OpenAI API 时需要了解的关键概念。

在 OpenAI,保护用户数据是我们使命的根本。我们不会使用通过 API 提交的输入和生成的输出 来训练模型。有关详情,请参阅我们的 API 数据隐私页面

文本生成模型

OpenAI 的文本生成模型通常称为生成式预训练 Transformer,简称“GPT”模型,例如 gpt-6-astragpt-5.6-terra。这些模型经过训练,能够理解自然语言和形式语言,并根据输入生成文本输出。模型的输入也称为“提示”。设计提示本质上就是为模型“编程”,通常是通过提供指令或一些成功完成任务的示例来实现。GPT 模型可用于多种任务,包括内容或代码生成、摘要、对话、创意写作等。有关详情,请阅读我们的入门文本生成指南提示工程指南

嵌入向量

嵌入向量是一段数据(例如文本)的向量表示,旨在保留其内容和/或含义的某些特征。相比于互不相关的数据,在某些方面相似的数据,其嵌入向量往往更接近。OpenAI 提供的文本嵌入模型以文本字符串为输入,输出嵌入向量。嵌入向量可用于搜索、聚类、推荐、异常检测、分类等。有关嵌入向量的更多信息,请阅读我们的嵌入向量指南

Token

文本生成模型和嵌入模型会将文本分成称为 Token 的片段进行处理。Token 表示常见的字符序列。例如,字符串 " tokenization" 会被拆分为 " token" 和 "ization",而像 " the" 这样简短且常见的单词则用单个 Token 表示。请注意,在句子中,每个单词的第一个 Token 通常以空格字符开头。您可以使用我们的Token 化工具测试特定字符串,查看它们如何转换为 Token。粗略估算,对于英文文本,1 个 Token 约等于 4 个字符或 0.75 个单词。

需要注意的一项限制是,对于文本生成模型,提示与生成输出的总长度不得超过模型的最大上下文长度。对于嵌入模型(不输出 Token),输入长度必须小于模型的最大上下文长度。您可以在模型索引中查看各个文本生成模型和嵌入模型的最大上下文长度。