Google actualiza la aplicación de Gemini para Mac con nuevas funciones de voz. La compañía presenta un sistema que permite hablarle a la computadora y obtener texto limpio, resúmenes o incluso imágenes editadas al instante. La novedad forma parte de la estrategia de Google para convertir a Gemini en un asistente que acompaña el flujo de trabajo diario. La idea central es simple: el usuario no necesita cambiar de aplicación ni dejar de escribir para pedirle ayuda a la inteligencia artificial. Basta con hablar.

Cómo se activa la nueva función de Gemini para Mac
Para usar esta herramienta, el usuario mantiene presionada la tecla Fn en cualquier ventana del escritorio. Esta acción activa el modo de dictado inteligente. El sistema transcribe la voz en texto pulido y elimina automáticamente las muletillas, las pausas y las correcciones a mitad de frase.
El texto resultante aparece directamente donde está el cursor. No hace falta copiar ni pegar nada. Gemini también muestra una pequeña «píldora» flotante con una forma de onda en la parte inferior de la pantalla mientras escucha.
Esta experiencia recuerda a la función Gboard Rambler, que Google ya prepara para los futuros teléfonos con Gemini Intelligence. Ambas herramientas comparten el mismo objetivo: transformar el habla espontánea en texto ordenado y natural.
Una función que entiende lo que hay en pantalla
Más allá del dictado simple, Gemini para Mac ofrece una segunda capacidad más avanzada. Se llama razonamiento de Gemini y hay que activarla manualmente en la configuración de la aplicación. Una vez encendida, el asistente entiende el contexto visual del escritorio y ejecuta tareas complejas a partir de una orden hablada.
Este modo abre varias posibilidades concretas:
Extraer y resumir información. El usuario selecciona archivos, imágenes o documentos en su escritorio y le pide a Gemini que resuma o redacte algo con esos datos. Un ejemplo que da Google es pedirle que lea archivos veterinarios y redacte un correo con el historial médico de una mascota.
Redactar y reescribir texto. Basta con seleccionar cualquier texto en pantalla y pedirle a Gemini que cambie el tono o lo convierta en otro formato. Por ejemplo, transformar unas notas sueltas en un resumen ejecutivo con una síntesis al principio.
Generar y editar imágenes. El usuario puede crear una imagen desde cero con la voz o pedirle a Gemini que modifique un diseño ya existente en la pantalla. Un caso típico es pedir una versión en modo oscuro de una ilustración.
Para activar este modo de razonamiento visual también existe otra vía: tocar el botón de compartir pantalla que aparece al final del cuadro de «Preguntar a Gemini».
Disponibilidad y requisitos técnicos
La función llega de forma global a todos los usuarios de la aplicación de Gemini para macOS. Por ahora funciona solo en inglés, aunque Google adelanta que sumará más idiomas próximamente. El despliegue es gradual, así que no todos los usuarios la ven al mismo tiempo el mismo día.
Es necesario tener instalada la versión 1.88 de la aplicación como mínimo. Quienes no cuenten con ella deben actualizar desde el sitio oficial de descarga de Gemini para Mac.
Este anuncio no aparece de la nada. Google ya había mostrado un adelanto de estas capacidades durante su conferencia de desarrolladores I/O, celebrada en mayo de 2026. En aquel momento, la función se presentó como una vista previa limitada. Ahora se convierte en un lanzamiento real y accesible para el público general.
Contexto: la carrera por los asistentes de voz en el escritorio
Este movimiento se suma a una tendencia más amplia. Las grandes tecnológicas compiten por integrar inteligencia artificial directamente en el sistema operativo, sin que el usuario tenga que abrir una app aparte cada vez que necesita ayuda. Apple, Microsoft y Google avanzan en direcciones similares, aunque con enfoques distintos.
Google apuesta por la voz como puente natural entre el usuario y sus tareas cotidianas. La compañía busca que Gemini funcione como una capa transversal, presente en cualquier ventana, documento o imagen abierta en el equipo.
La función de dictado inteligente compite de forma directa con herramientas de transcripción que ya existen en macOS y en aplicaciones de terceros. La diferencia que destaca Google es la limpieza del texto final: sin repeticiones, sin errores de pronunciación y con formato listo para usar.
El componente de razonamiento visual, en cambio, va un paso más allá. No se limita a transcribir, sino que interpreta el contenido de la pantalla como si fuera parte de la conversación. Esto acerca a Gemini a un asistente capaz de actuar sobre el trabajo real del usuario, no solo de responder preguntas sueltas.
Por ahora, la función se limita a macOS. Google no confirma todavía si estas capacidades de voz y comprensión visual llegarán pronto a Windows o a otros sistemas de escritorio. Tampoco especifica una fecha exacta para la llegada de nuevos idiomas más allá del inglés.
La actualización refuerza la posición de Gemini como una herramienta cada vez más integrada en el día a día de quienes trabajan desde una computadora Mac. El siguiente paso lógico, según el propio ritmo de lanzamientos de Google en 2026, apunta a expandir estas funciones a más plataformas y más idiomas en los próximos meses.















