OpenAI presentó GPT‑Realtime‑2 y dos nuevas variantes de voz disponibles solo a través de la API
OpenAI expande las capacidades de su API de voz
La compañía anunció el lanzamiento de nuevas funciones para su API que permitirán a los desarrolladores crear aplicaciones de voz más “vivas”: podrán conversar con usuarios, transcribir el habla en texto y traducir conversaciones al instante.
Nuevos modelos Realtime
A través de la interfaz Realtime ahora están disponibles tres modelos:
| Modelo | Propósito | Características clave |
|---|---|---|
| GPT‑Realtime‑2 | Interacción vocal en tiempo real | Análisis de consultas, llamada a herramientas, manejo de correcciones y continuación fluida del diálogo. Basado en GPT‑5, lo que permite abordar tareas más complejas que GPT‑Realtime‑1.5. |
| GPT‑Realtime‑Translate | Traducción en tiempo real | Soporta más de 70 idiomas de entrada y 13 de salida. Mantiene el sentido incluso con cambios de contexto, acentos regionales o terminología especializada. |
| GPT‑Realtime‑Whisper | Transcripción del habla | Modelo de streaming de baja latencia que convierte audio en texto casi instantáneamente. |
> “Nuestros nuevos modelos traducen audio en tiempo real desde un diálogo sencillo a interfaces vocales que realmente pueden funcionar: escuchar, razonar, traducir, transcribir y tomar acciones conforme avanza la conversación”, afirmó la compañía.
Costos
Modelo | Precio
---|---
GPT‑Realtime‑2 | $32 por 1 millón de tokens de audio entrantes, $0.40 por 1 millón de tokens en caché y $64 por 1 millón de tokens de audio salientes
GPT‑Realtime‑Translate | $0.034 por minuto
GPT‑Realtime‑Whisper | $0.017 por minuto
Cómo probarlo
Los desarrolladores pueden probar los nuevos modelos en la plataforma online OpenAI Playground y ver inmediatamente cómo funcionan en tiempo real.
Comentarios (0)
Comparte tu opinión — por favor, sé amable y mantente en el tema.
Inicia sesión para comentar