Redacción Internacional.- Google presentó Gemini 3.5 Transcribe, una nueva herramienta de inteligencia artificial capaz de convertir voz en texto y reconocer más de 85 idiomas, incluso cuando existen acentos regionales marcados, ruido de fondo o vocabulario especializado.

La función está diseñada para trabajar en contextos multilingües y puede detectar cambios de idioma dentro de una misma conversación, lo que amplía su utilidad para reuniones internacionales, entrevistas, conferencias, llamadas y creación de subtítulos.

Más de 85 idiomas y distintos acentos

Uno de los puntos centrales de Gemini 3.5 Transcribe es precisamente su alcance lingüístico. El modelo puede procesar audios en más de 85 idiomas y adaptarse a diferentes formas de pronunciación, lo que busca reducir errores frecuentes en sistemas tradicionales de transcripción.

La herramienta también puede reconocer acentos regionales y términos especializados, una característica que puede ser útil en sectores como la medicina, el derecho, la tecnología o los negocios, donde una palabra mal interpretada puede cambiar el sentido de una conversación.

Además, el sistema permite distinguir entre diferentes hablantes dentro de un mismo audio, lo que facilita la transcripción de reuniones, entrevistas y conversaciones con varias personas.

Suscribete al newsletter de Noticias SIN

Transcripción más limpia y organizada

Gemini 3.5 Transcribe no se limita a copiar literalmente lo que escucha. El sistema también puede eliminar muletillas, corregir repeticiones y organizar automáticamente el texto con puntuación, mayúsculas y formato.

Según los datos difundidos sobre el modelo, registra una tasa promedio de error de 4 % en transmisiones en vivo y de 2.6 % en audios grabados, lo que lo coloca entre las herramientas de transcripción con mayor precisión.

La plataforma ofrece además una modalidad para transcripción en tiempo real, con baja latencia, y otra destinada a archivos previamente grabados, que incluye identificación de hablantes y marcas de tiempo.

Google integra esta tecnología en distintos productos y servicios, entre ellos Gboard para Android, la aplicación Gemini y otras plataformas de la compañía, con el objetivo de ampliar las funciones de dictado, subtitulado y reconocimiento de voz en diferentes idiomas.

Temasgemini 3 5 transcribegoogleinteligencia artificialmultilingüereconocimiento de voztranscripción de audio