在 OpenAI,保護使用者資料是我們使命的根本。我們不會使用透過 API 傳入與傳出的資料 來訓練模型。如需進一步瞭解,請參閱我們的 API 資料隱私權頁面。
文字生成模型
OpenAI 的文字生成模型通常稱為生成式預訓練 Transformer,簡稱「GPT」模型,例如 gpt-6-astra 和 gpt-5.6-terra。這些模型經過訓練,能理解自然語言和形式語言,並根據輸入產生文字輸出。模型接收的輸入也稱為「提示詞」。設計提示詞,本質上就是為模型「編寫程式」,通常是提供指示或一些成功完成任務的範例。GPT 模型可用於各種任務,包括內容或程式碼生成、摘要、對話、創意寫作等。詳情請參閱我們的入門文字生成指南及提示工程指南。
嵌入向量
嵌入向量是將一筆資料(例如一段文字)以向量表示,目的是保留其內容、含義,或兩者的某些特徵。相較於互不相關的資料,在某些方面相似的資料,其嵌入向量通常也會更接近。OpenAI 提供文字嵌入模型,以文字字串作為輸入,並輸出嵌入向量。嵌入向量可用於搜尋、分群、推薦、異常偵測、分類等用途。如需進一步瞭解,請參閱我們的嵌入向量指南。
Token
文字生成模型和嵌入模型會將文字切分為稱為 Token 的區塊來處理。Token 代表常見的字元序列。例如,字串 " tokenization" 會拆分為 " token" 和 "ization",而像 " the" 這類簡短且常見的單字則以單一 Token 表示。請注意,在句子中,每個單字的第一個 Token 通常以空白字元開頭。你可以使用我們的 Token 化工具測試特定字串,查看它們如何轉換為 Token。粗略估計,對英文文字而言,1 個 Token 約相當於 4 個字元或 0.75 個單字。
有一項限制需要留意:對文字生成模型而言,提示詞與生成輸出的總長度不得超過模型的最大上下文長度。對嵌入模型(不會輸出 Token)而言,輸入長度必須小於模型的最大上下文長度。各文字生成模型和嵌入模型的最大上下文長度可在模型索引中查閱。