En OpenAI, proteger los datos de los usuarios es fundamental para nuestra misión. No entrenamos nuestros modelos con las entradas y salidas de nuestra API. Obtén más información en nuestra página sobre la privacidad de los datos de la API.
Modelos de generación de texto
Los modelos de generación de texto de OpenAI (conocidos como transformadores generativos preentrenados o modelos “GPT”, por sus siglas en inglés), como gpt-6-astra y gpt-5.6-terra, se han entrenado para comprender el lenguaje natural y formal. Estos modelos generan texto en respuesta a las entradas que reciben. Las entradas de estos modelos también se conocen como “prompts”. Diseñar un prompt es, en esencia, la forma de “programar” un modelo, generalmente mediante instrucciones o ejemplos de cómo completar una tarea correctamente. Los modelos GPT se pueden usar para una gran variedad de tareas, como generar contenido o código, resumir, conversar, escribir textos creativos y más. Obtén más información en nuestra guía introductoria de generación de texto y en nuestra guía de ingeniería de prompts.
Embeddings
Un embedding es una representación vectorial de un dato (por ejemplo, un fragmento de texto) cuyo propósito es conservar aspectos de su contenido o significado, o de ambos. Los fragmentos de datos que se parecen en algún aspecto tienden a tener embeddings más cercanos entre sí que los de datos sin relación. OpenAI ofrece modelos de embeddings de texto que reciben una cadena de texto como entrada y producen un vector de embedding como salida. Los embeddings son útiles para búsquedas, agrupamiento, recomendaciones, detección de anomalías, clasificación y más. Obtén más información sobre los embeddings en nuestra guía de embeddings.
Tokens
Los modelos de generación de texto y de embeddings procesan el texto en fragmentos llamados tokens. Los tokens representan secuencias de caracteres que aparecen con frecuencia. Por ejemplo, la cadena “ tokenization” se descompone en “ token” e “ization”, mientras que una palabra corta y común como “ the” se representa con un solo token. Ten en cuenta que, en una oración, el primer token de cada palabra suele comenzar con un carácter de espacio. Usa nuestra herramienta de tokenización para probar cadenas específicas y ver cómo se convierten en tokens. Como regla general aproximada, 1 token equivale a unos 4 caracteres o 0,75 palabras en textos en inglés.
Una limitación que debes tener en cuenta es que, en un modelo de generación de texto, la longitud combinada del prompt y la salida generada no debe superar la longitud máxima de contexto del modelo. En los modelos de embeddings (que no generan tokens de salida), la entrada debe ser más corta que la longitud máxima de contexto del modelo. Puedes consultar las longitudes máximas de contexto de cada modelo de generación de texto y de embeddings en el índice de modelos.