For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Prácticas recomendadas para producción

Lleva tus proyectos de IA a producción con prácticas recomendadas.

Esta guía ofrece un conjunto completo de prácticas recomendadas para ayudarte a pasar del prototipo a producción. Tanto si tienes experiencia en ingeniería de aprendizaje automático como si apenas comienzas a explorar el tema, esta guía te dará las herramientas que necesitas para usar la plataforma con éxito en un entorno de producción: desde proteger el acceso a nuestra API hasta diseñar una arquitectura sólida que pueda manejar grandes volúmenes de tráfico. Úsala para elaborar un plan que te permita desplegar tu aplicación de la manera más fluida y eficaz posible.

Si quieres profundizar en las prácticas recomendadas para pasar a producción, consulta nuestra charla de Developer Day:

Configurar tu organización

Una vez que inicies sesión en tu cuenta de OpenAI, puedes encontrar el nombre y el ID de tu organización en la configuración de la organización. El nombre es la etiqueta que identifica a tu organización en las interfaces de usuario. El ID es el identificador único de tu organización y se puede usar en las solicitudes a la API.

Los usuarios que pertenecen a varias organizaciones pueden enviar un encabezado para especificar qué organización se usa en una solicitud a la API. El consumo de estas solicitudes se contabilizará dentro de la cuota de la organización especificada. Si no se proporciona un encabezado, se facturará a la organización predeterminada. Puedes cambiar tu organización predeterminada en la configuración de usuario.

Puedes invitar a nuevos miembros a tu organización desde la página Equipo. Los miembros pueden ser lectores o propietarios.

Lectores:

  • Pueden realizar solicitudes a la API.
  • Pueden consultar la información básica de la organización.
  • Pueden crear, actualizar y eliminar recursos (como Assistants) en la organización, salvo que se indique lo contrario.

Propietarios:

  • Tienen todos los permisos de los lectores.
  • Pueden modificar la información de facturación.
  • Pueden administrar los miembros de la organización.

Gestionar los límites de facturación

Una vez que ingresas tu información de facturación, OpenAI establece un límite de uso aprobado para tu organización. Tu cuota aumentará automáticamente a medida que aumente tu uso de la plataforma y pases de un nivel de uso a otro. Puedes consultar tu límite de uso actual en la página de límites, dentro de la configuración de tu cuenta.

Configura alertas de gasto en la página de límites para enviar notificaciones cuando el consumo supere un monto determinado en dólares. Para aplicar un tope mensual, establece un límite estricto de gasto. Los límites estrictos de gasto detienen el tráfico de la API al que se aplican cuando el gasto registrado alcanza el límite, así que consulta la guía de límites de gasto antes de habilitar uno en producción.

Claves de API

La API de OpenAI usa claves de API para la autenticación. Visita la página de claves de API para obtener la clave que usarás en tus solicitudes.

Esta es una forma relativamente sencilla de controlar el acceso, pero debes prestar especial atención a la protección de estas claves. Evita exponer las claves de API en tu código o en repositorios públicos; guárdalas en un lugar seguro. Proporciónalas a tu aplicación mediante variables de entorno o un servicio de gestión de secretos para no tener que incorporarlas directamente en el código. Obtén más información en nuestras prácticas recomendadas para proteger las claves de API.

Te recomendamos encarecidamente que establezcas una fecha de vencimiento al crear una clave de API de proyecto y un proceso periódico de rotación de claves. Antes de que una clave venza, crea una nueva para reemplazarla, actualiza tus aplicaciones para que la usen y revoca la clave anterior una vez que hayas verificado que la nueva funciona.

Los administradores pueden establecer un plazo máximo de vigencia para las claves de API a nivel de organización o proyecto en la configuración de la plataforma. Las claves nuevas deben vencer dentro del límite configurado, lo que impide que sigan siendo válidas indefinidamente. Los límites de los proyectos no pueden superar el límite de la organización.

La sección Gobernanza de claves de API en la configuración de la plataforma permite a los administradores de organizaciones y proyectos restringir los tipos de claves de API que se pueden crear. Los administradores pueden permitir únicamente claves de cuentas de servicio, permitir únicamente claves de proyecto que pertenezcan a usuarios o deshabilitar por completo la creación de nuevas claves de API. Las restricciones de la organización siempre tienen prioridad: la configuración del proyecto puede agregar restricciones, pero no flexibilizar las de la organización. Estos controles se aplican únicamente a la creación de nuevas claves; las claves de API existentes no se ven afectadas.

Puedes monitorear el uso de las claves de API en la página Uso una vez que el seguimiento esté habilitado. Si usas una clave de API generada antes del 20 de diciembre de 2023, el seguimiento no estará habilitado de forma predeterminada. Puedes habilitarlo para el uso futuro en el panel de administración de claves de API. Todas las claves de API generadas después del 20 de diciembre de 2023 tienen el seguimiento habilitado. Cualquier uso anterior sin seguimiento se mostrará como Untracked en el panel.

Proyectos de preproducción

A medida que escales, puede que te convenga crear proyectos separados para tus entornos de preproducción y producción. Puedes crear estos proyectos en el panel para aislar el trabajo de desarrollo y pruebas y evitar interrumpir accidentalmente tu aplicación en producción. También puedes limitar el acceso de los usuarios al proyecto de producción y establecer límites de solicitudes y de gasto personalizados para cada proyecto.

Escalar la arquitectura de tu solución

Al diseñar una aplicación o un servicio que use nuestra API para su uso en producción, es importante considerar cómo escalarlo para atender la demanda de tráfico. Deberás tener en cuenta algunos aspectos clave, independientemente del proveedor de servicios en la nube que elijas:

  • Escalamiento horizontal: puede que te convenga escalar tu aplicación horizontalmente para atender solicitudes provenientes de varias fuentes. Esto podría implicar desplegar servidores o contenedores adicionales para distribuir la carga. Si eliges este tipo de escalamiento, asegúrate de que tu arquitectura esté diseñada para manejar varios nodos y de contar con mecanismos para equilibrar la carga entre ellos.
  • Escalamiento vertical: otra opción es escalar tu aplicación verticalmente, es decir, aumentar los recursos disponibles en un solo nodo. Esto implicaría mejorar las capacidades de tu servidor para manejar la carga adicional. Si eliges este tipo de escalamiento, asegúrate de que tu aplicación esté diseñada para aprovechar estos recursos adicionales.
  • Almacenamiento en caché: al almacenar los datos que se consultan con frecuencia, puedes mejorar los tiempos de respuesta sin necesidad de realizar llamadas repetidas a nuestra API. Tu aplicación deberá estar diseñada para usar datos en caché siempre que sea posible e invalidar la caché cuando se agregue información nueva. Por ejemplo, podrías almacenar datos en una base de datos, un sistema de archivos o una caché en memoria, según lo que resulte más adecuado para tu aplicación.
  • Balanceo de carga: por último, considera técnicas de balanceo de carga para garantizar que las solicitudes se distribuyan de manera uniforme entre los servidores disponibles. Esto podría implicar colocar un balanceador de carga delante de tus servidores o usar DNS round-robin. Equilibrar la carga ayudará a mejorar el rendimiento y reducir los cuellos de botella.

Gestionar los límites de solicitudes

Al usar nuestra API, es importante comprender los límites de solicitudes y tenerlos en cuenta al planificar.

Reducir la latencia

Consulta nuestra guía más actualizada sobre optimización de la latencia.

La latencia es el tiempo que tarda en procesarse una solicitud y devolverse una respuesta. En esta sección, analizaremos algunos factores que influyen en la latencia de nuestros modelos de generación de texto y ofreceremos sugerencias para reducirla.

La latencia de una solicitud de generación de texto depende principalmente de dos factores: el modelo y la cantidad de tokens generados. El ciclo de vida de una solicitud de generación de texto es el siguiente:

Network
End user to API latency
Server
Time to process prompt tokens
Server
Time to sample/generate tokens
Network
API to end user latency

La mayor parte de la latencia suele provenir de la etapa de generación de tokens.

Explicación intuitiva: los tokens del prompt agregan poca latencia a las llamadas de generación de respuestas. Generar los tokens de la respuesta toma mucho más tiempo, ya que se generan uno por uno. Las respuestas más largas acumulan latencia debido al tiempo necesario para generar cada token.

Factores comunes que afectan la latencia y posibles técnicas para mitigarla

Ahora que hemos repasado los conceptos básicos de la latencia, veamos varios factores que pueden afectarla, ordenados de forma general de mayor a menor impacto.

Modelo

Nuestra API ofrece distintos modelos con diversos niveles de complejidad y versatilidad. Los modelos más capaces, como gpt-6-astra, pueden generar respuestas más complejas y variadas, pero también tardan más en procesar tu consulta. Modelos como gpt-5.6-terra y gpt-5.6-luna pueden generar respuestas más rápidas y económicas, mientras que gpt-6-astra es una opción predeterminada más sólida cuando necesitas mayor capacidad para tareas complejas. Puedes elegir el modelo que mejor se adapte a tu caso de uso y al equilibrio que buscas entre velocidad, costo y calidad.

Cantidad de tokens de respuesta

Solicitar respuestas con una gran cantidad de tokens generados puede aumentar la latencia:

  • Reduce el máximo de tokens: entre solicitudes con una cantidad similar de tokens generados, las que tienen un valor menor en el parámetro max_tokens presentan menos latencia.
  • Incluye secuencias de parada: para evitar generar tokens innecesarios, agrega una secuencia de parada. Por ejemplo, puedes usar secuencias de parada para generar una lista con una cantidad específica de elementos. En este caso, al usar 11. como secuencia de parada, puedes generar una lista de solo 10 elementos, ya que la generación de la respuesta se detendrá al llegar a 11.. Lee nuestro artículo de ayuda sobre las secuencias de parada para obtener más información sobre cómo hacerlo.
  • Genera menos respuestas: reduce los valores de n y best_of cuando sea posible. El parámetro n indica cuántas respuestas se deben generar para cada prompt, y best_of se usa para representar el resultado con la mayor probabilidad logarítmica por token.

Si tanto n como best_of son iguales a 1 (el valor predeterminado), la cantidad de tokens generados será, como máximo, igual a max_tokens.

Si n (la cantidad de respuestas devueltas) o best_of (la cantidad de respuestas generadas para su consideración) se configuran en > 1, cada solicitud creará varias salidas. En este caso, puedes considerar que la cantidad de tokens generados es [ max_tokens * max (n, best_of) ]

Streaming

Configurar stream: true en una solicitud hace que el modelo comience a devolver tokens en cuanto estén disponibles, en lugar de esperar a que se genere toda la secuencia. Esto no cambia el tiempo necesario para obtener todos los tokens, pero reduce el tiempo hasta recibir el primero en una aplicación en la que se quiera mostrar el progreso parcial o detener la generación. Esto puede mejorar la experiencia de usuario, por lo que vale la pena experimentar con el streaming.

Procesamiento por lotes

Según tu caso de uso, el procesamiento por lotes puede ser útil. Si envías varias solicitudes al mismo punto de acceso, puedes agrupar los prompts en un lote para enviarlos en una sola solicitud. Esto reducirá la cantidad de solicitudes que necesitas realizar. El parámetro prompt puede contener hasta 20 prompts únicos. Te recomendamos probar este método y comprobar si te resulta útil. En algunos casos, podrías terminar aumentando la cantidad de tokens generados, lo que alargaría el tiempo de respuesta.

Gestión de costos

Para monitorear tus costos, puedes establecer un umbral de notificación en tu cuenta y recibir una alerta por correo electrónico cuando superes un determinado umbral de uso. Usa el panel de seguimiento de uso para monitorear tu consumo de tokens durante el ciclo de facturación actual y los anteriores.

Generación de texto

Uno de los desafíos de llevar tu prototipo a producción es presupuestar los costos de ejecutar tu aplicación. OpenAI ofrece un modelo de precios de pago por uso, con precios por cada 1000 tokens (aproximadamente 750 palabras). Para estimar tus costos, tendrás que proyectar el consumo de tokens. Considera factores como los niveles de tráfico, la frecuencia con la que los usuarios interactuarán con tu aplicación y la cantidad de datos que procesarás.

Una forma útil de analizar cómo reducir los costos es considerarlos en función de la cantidad de tokens y el costo por token. Con este enfoque, puedes abordar la reducción de costos de dos maneras. Primero, podrías reducir el costo por token usando modelos más pequeños para algunas tareas. Como alternativa, podrías intentar reducir la cantidad de tokens necesarios. Hay varias formas de hacerlo, como usar prompts más cortos, realizar el ajuste fino de modelos o almacenar en caché las consultas frecuentes de los usuarios para no tener que procesarlas repetidamente.

Puedes experimentar con nuestra herramienta de tokenización interactiva para estimar los costos. La API y el Playground también devuelven la cantidad de tokens como parte de la respuesta. Una vez que todo funcione con nuestro modelo más capaz, puedes comprobar si los otros modelos producen los mismos resultados con menor latencia y menores costos. Obtén más información en nuestro artículo de ayuda sobre el uso de tokens.

Estrategia de MLOps

Al llevar tu prototipo a producción, puede que te convenga desarrollar una estrategia de MLOps. MLOps (operaciones de aprendizaje automático) se refiere al proceso de gestionar el ciclo de vida completo de tus modelos de aprendizaje automático, incluidos aquellos a los que estés realizando un ajuste fino con nuestra API. Considera las siguientes áreas al diseñar tu estrategia de MLOps:

  • Gestión de datos y modelos: gestionar los datos utilizados para entrenar tu modelo o realizar ajustes finos, y llevar un registro de las versiones y los cambios.
  • Monitoreo del modelo: hacer un seguimiento del rendimiento de tu modelo a lo largo del tiempo y detectar posibles problemas o deterioros.
  • Reentrenamiento del modelo: mantener tu modelo actualizado ante cambios en los datos o en los requisitos, y volver a entrenarlo o realizar ajustes finos según sea necesario.
  • Despliegue del modelo: automatizar el proceso de despliegue de tu modelo y los artefactos relacionados en producción.

Analizar estos aspectos de tu aplicación ayudará a que tu modelo siga siendo relevante y mantenga un buen rendimiento a lo largo del tiempo.

Seguridad y cumplimiento

Al pasar tu prototipo a producción, tendrás que evaluar y atender los requisitos de seguridad y cumplimiento que puedan aplicarse a tu aplicación. Esto implica examinar los datos que manejas, comprender cómo nuestra API procesa los datos y determinar qué normativas debes cumplir. Nuestras prácticas de seguridad y nuestro portal de confianza y cumplimiento ofrecen nuestra documentación más completa y actualizada. Como referencia, aquí encontrarás nuestra Política de privacidad y nuestros Términos de uso.

Algunos aspectos habituales que tendrás que considerar son el almacenamiento, la transmisión y la retención de datos. También es posible que debas implementar medidas para proteger la privacidad de los datos, como el cifrado o la anonimización cuando sea posible. Además, debes seguir prácticas recomendadas de programación segura, como la sanitización de entradas y el manejo adecuado de errores.

Prácticas recomendadas de seguridad

Al crear tu aplicación con nuestra API, ten en cuenta nuestras prácticas recomendadas de seguridad para garantizar que tu aplicación sea segura y exitosa. Estas recomendaciones destacan la importancia de probar el producto exhaustivamente, abordar de forma proactiva los posibles problemas y limitar las oportunidades de uso indebido.

Consideraciones de negocio

A medida que los proyectos que utilizan IA pasan de prototipo a producción, es importante considerar cómo crear un gran producto con IA y cómo se relaciona con la actividad principal de tu negocio. Por supuesto, no tenemos todas las respuestas, pero un buen punto de partida es una charla de nuestro Developer Day en la que profundizamos en este tema con algunos de nuestros clientes: