Google ha presentado Gemini 3.5 Transcribe, un modelo de inteligencia artificial diseñado para la conversión avanzada de voz a texto. Esta nueva herramienta se distingue por ir más allá de la simple transcripción literal, incorporando capacidades de limpieza, ordenamiento y corrección del discurso antes de su visualización.
Transcripción Inteligente: Más Allá del Dictado Convencional
La funcionalidad central de Gemini 3.5 Transcribe reside en lo que Google denomina “transcripción inteligente”. Este sistema es capaz de interpretar y aplicar correcciones realizadas en tiempo real. Por ejemplo, si un usuario pronuncia “quedamos el martes… no, el miércoles”, el sistema procesa directamente la última corrección, resultando en la transcripción “quedamos el miércoles”.
Entre sus características destacadas se incluyen:
- Eliminación automática de muletillas y palabras de relleno.
- Aplicación de puntuación y formato adecuados.
- Detección de más de 85 idiomas.
- Reconocimiento simultáneo de hasta tres interlocutores.
- Adición de marcas de tiempo precisas para cada palabra.
- Capacidad para funcionar eficazmente en entornos con ruido, acentos diversos o terminología técnica.
Además, la herramienta permite la incorporación de vocabularios personalizados, lo que facilita el reconocimiento de nombres propios, términos profesionales o palabras poco comunes, optimizando su rendimiento en contextos específicos.
Rendimiento y Eficiencia
Según los datos proporcionados por Google, Gemini 3.5 Transcribe exhibe una tasa de error por palabra del 4% en transcripciones en tiempo real (streaming) y del 2.6% en audios pregrabados. Su capacidad para identificar combinaciones alfanuméricas como códigos postales o números de pedido, junto con la posibilidad de combinar idiomas en una misma transcripción, amplía su versatilidad.
La velocidad de procesamiento es un factor clave. Google afirma que el tiempo de transcripción se ha reducido en un 70% en comparación con su modelo anterior, Chirp 3. En operaciones en directo, la latencia es inferior a un segundo, lo que lo hace idóneo para aplicaciones que requieren una respuesta inmediata, como subtítulos en tiempo real o asistentes de voz.
Integración y Disponibilidad
Gemini 3.5 Transcribe no es una herramienta independiente, sino que se integra en el ecosistema de Google. Ya forma parte de las funcionalidades de Android y Gemini en macOS, permitiendo a los usuarios interactuar con la IA mediante comandos de voz para diversas tareas, incluyendo el análisis de archivos o la generación de imágenes a través de otros modelos Gemini.
Para la comunidad de desarrolladores, Gemini 3.5 Transcribe está disponible en vista previa pública a través de la API de Gemini y Google AI Studio, así como en las herramientas empresariales de la compañía. Google también lo está implementando en Gboard y Antigravity, extendiendo su alcance a más plataformas.
A futuro, se prevé su llegada a Google Chrome, lo que permitirá a los usuarios dictar directamente en cualquier campo de texto de una página web. Esta funcionalidad simplificará tareas como redactar correos electrónicos, completar formularios o enviar mensajes, todo mediante la voz.