Saltar al contenido principal
EN VIVO
BTC: $63,863.71ETH: $1,854.47SOL: $73.85USD/BCV: 742.23 BsEUR/BCV: 844.22 BsBTC: $63,863.71ETH: $1,854.47SOL: $73.85USD/BCV: 742.23 BsEUR/BCV: 844.22 BsBTC: $63,863.71ETH: $1,854.47SOL: $73.85USD/BCV: 742.23 BsEUR/BCV: 844.22 BsBTC: $63,863.71ETH: $1,854.47SOL: $73.85USD/BCV: 742.23 BsEUR/BCV: 844.22 Bs
Inteligencia Artificial

OpenAI estrena ChatGPT Voice en la app de escritorio: así funciona el nuevo modo de voz

OpenAI estrena ChatGPT Voice en la app de escritorio: así funciona el nuevo modo de voz

OpenAI lanzó este jueves la integración de su modo de voz, ChatGPT Voice, en la aplicación de escritorio de ChatGPT. La función, anunciada el 23 de julio de 2026, permite dictar instrucciones complejas, manejar varios agentes de inteligencia artificial a la vez y ejecutar tareas concretas en el ordenador sin tocar el teclado.

El sistema funciona con los nuevos modelos de voz GPT-Live, que la compañía presentó a principios de este mismo mes. A diferencia de la versión para teléfonos, que solo conversaba, la edición de escritorio está diseñada para actuar: habla, escucha y coordina el trabajo de varios agentes dentro de ChatGPT Work y Codex. Además, en macOS la aplicación puede examinar lo que hay en pantalla a través de Appshots, una herramienta que le permite leer textos alternativos y botones, y así automatizar tareas que involucran otras ventanas o sitios web.

El salto respecto al móvil es notable. ChatGPT Voice debutó en los teléfonos con conversaciones más naturales y una gestión mejorada de las interrupciones, pero se limitaba a responder y mantener el hilo de la charla. La versión de escritorio rompe esa barrera: ahora puede encadenar comandos de varios pasos y pedir confirmación al usuario cuando necesita un dato adicional o una validación antes de proseguir. Esa interacción de ida y vuelta evita bloqueos y hace posible flujos de trabajo completos.

Del código a la pantalla: qué puede hacer el asistente

En una demostración compartida por OpenAI, un desarrollador pidió al sistema con una sola frase: «crea un nuevo hilo, haz un pull request y encuentra la causa raíz del error». ChatGPT Voice ejecutó las tres acciones de forma consecutiva, deteniéndose solo para solicitar aprobación cuando algún paso lo requería. Este tipo de instrucciones encadenadas apunta directamente a tareas de programación, donde históricamente los asistentes de código han dependido de comandos escritos.

Más allá del código, la función echa mano de las capacidades de «computer use» que OpenAI viene afinando. ChatGPT Voice puede consultar páginas web y aplicaciones por iniciativa propia cuando una tarea lo necesita: buscar documentación técnica en línea, extraer datos de una tabla en un sitio o comparar información entre varias fuentes sin que el usuario deba abrir el navegador. Appshots, la función exclusiva de macOS por ahora, refuerza esta posibilidad al darle acceso visual a lo que está en pantalla, incluidos los metadatos de interfaz.

OpenAI también confirmó que se puede controlar ChatGPT Voice en Codex desde la app de iOS mediante acceso remoto. Así, un desarrollador podría iniciar una tarea larga en su computadora desde el teléfono, dictar instrucciones por voz y recibir confirmaciones sin estar sentado frente al equipo. Esta conexión entre móvil y escritorio amplía la flexibilidad del asistente.

El empujón de la competencia

El movimiento de OpenAI coincide con una actualización similar de Anthropic. Hace pocos días, la empresa anunció que su modo de voz para Claude ya es capaz de usar los modelos Opus, Sonnet y Haiku para ejecutar tareas dentro de aplicaciones como Gmail, Calendar, Slack, Notion y Canva. Ambos desarrollos muestran que la inteligencia artificial conversacional está dejando de ser un chatbot de preguntas y respuestas para transformarse en un verdadero operador de software.

El lanzamiento de ChatGPT Voice en escritorio, que se apoya en los modelos GPT-Live presentados el 8 de julio, llega con un despliegue global progresivo desde el 23 de julio. La compañía lo detalló en un anuncio en X y la actualización se irá liberando para todos los usuarios de la aplicación de ChatGPT en Windows y macOS.

Mientras tanto, la inteligencia artificial aplicada a la productividad sigue sumando fichas. Hace unas semanas, Google retrasó el lanzamiento de Gemini 3.5 Pro para mejorar sus capacidades de programación, una señal de que las grandes tecnológicas apuestan por asistentes que generen código y, además, ejecuten tareas en el entorno de trabajo del desarrollador.

Comentarios

Relacionados

Ver más