Google lanza Gemini 3.5 Transcribe: speech-to-text en 85+ idiomas con WER de 2.6%

El modelo de voz a texto más preciso de Google
Google ha presentado Gemini 3.5 Transcribe, su modelo de conversión de voz a texto más preciso hasta la fecha. Diseñado para interacciones de voz inteligentes, el modelo transcribe habla natural en más de 85 idiomas, eliminando palabras de relleno, manejando autocorrecciones y capturando la intención final del hablante.
Características principales
Filtrado inteligente de disfluencias
El modelo elimina automáticamente palabras de relleno como "ums", "ahs" y vacilaciones. No es una simple eliminación de palabras: el modelo entiende cuándo el hablante se corrige a sí mismo. Si dices "Envía el reporte a las 4... actually, que sean las 5", transcribe solo tu intención final: "Envía el reporte a las 5".
Reconocimiento multi-hablante
Distingue hasta 3 hablantes distintos con marcas de tiempo, detectando acentos regionales y dialectos. Esto lo hace útil para transcribir reuniones, entrevistas y conversaciones grupales.
Code-switching entre idiomas
Si cambias de idioma mid-conversación (común en hablantes bilingües), el modelo lo maneja sin problema. Detecta automáticamente el idioma sin selección manual.
Formato contextual
Convierte automáticamente el habla en sintaxis proper:
- Números: "$26M" en lugar de "veintiséis millones de dólares"
- Fechas: formato correcto según contexto
- Moneda: símbolos apropiados
- Direcciones: formato estructurado
Métricas de precisión
| Métrica | Valor |
|---|---|
| WER (Word Error Rate) streaming | 4.0% |
| WER no-streaming | 2.6% |
| Mejora en tiempo de transcripción | 70% vs modelo anterior |
| Idiomas soportados | 85+ |
| Hablantes distinguibles | Hasta 3 con timestamps |
Comparación con speech-to-text tradicional
| Feature | STT tradicional | Gemini 3.5 Transcribe |
|---|---|---|
| Palabras de relleno | Se transcriben ("um, so...") | Se filtran automáticamente |
| Correcciones mid-sentence | Se transcribe el error completo | Se resuelve a la intención final |
| Detección de idioma | Selección manual requerida | Auto-detecta 85+ idiomas |
| Formato | Texto literal | Contextual (fechas, números, moneda) |
| Multi-hablante | No soportado o limitado | Hasta 3 con timestamps |
Integraciones
Gboard (Android)
Transforma pensamientos hablados en texto, eliminando palabras de relleno. Permite dictar mensajes, emails y notas con precisión natural.
Google Antigravity
Combina contexto de pantalla y historial de chat del usuario para realizar transcripción precisa contextual. La transcripción entiende qué estás viendo y a qué te refieres.
Gemini App (macOS)
Comandos de voz que se integran con el contexto de pantalla. Permite:
- Resumir archivos con la voz
- Reutilizar texto entre apps
- Generar imágenes por voz
- Optimizar flujos de trabajo completos
Google AI Studio
Los desarrolladores pueden usar el modelo para escribir código de aplicaciones con la voz en el modo Build. Disponible como preview pública en la API Gemini.
Chrome (próximamente)
Google está trabajando en integrar Gemini 3.5 Transcribe en Chrome para que los usuarios puedan dictar texto en cualquier campo web. Esto significa redactar respuestas, publicaciones o usar Gemini con voz en cualquier sitio web.
Gemini Enterprise Agent Platform
Disponible en versión preliminar para clientes enterprise que necesitan transcripción a escala.
Casos de uso
- Reuniones y notas: transcribir reuniones con identificación de hablantes
- Dictado de documentos: redactar emails, informes, documentos con voz natural
- Coding por voz: escribir código en Google AI Studio
- Atención al cliente: transcribir llamadas en tiempo real con formato
- Accesibilidad: entrada de texto por voz para personas con movilidad reducida
- Contenido multilingüe: transcribir contenido en 85+ idiomas sin cambiar configuración
Disponibilidad
| Plataforma | Estado |
|---|---|
| Gemini app (macOS) | Disponible (inglés) |
| Rambler (Android) | Disponible |
| Google AI Studio (API) | Preview pública |
| Google Antigravity | Preview pública |
| Gemini Enterprise Agent Platform | Preview |
| Chrome | En desarrollo |
Por qué importa
El speech-to-text ha sido históricamente una experiencia frustrante: transcribe todo literalmente, incluyendo errores, vacilaciones y palabras de relleno. Gemini 3.5 Transcribe cambia el paradigma: no transcribe lo que dices, transcribe lo que quieres decir.
Con un WER de 2.6% en modo no-streaming, el modelo se acerca a la precisión humana. Y con integración nativa en Gboard, Chrome, Gemini y AI Studio, Google está posicionando la voz como un método de input primario, no como una característica de accesibilidad opcional.
Conclusión
Gemini 3.5 Transcribe representa un salto cualitativo en speech-to-text. No es solo más preciso (WER 2.6%), sino que entiende la intención: filtra rellenos, resuelve autocorrecciones, formatea contextualmente y maneja 85+ idiomas con code-switching. Si Google logra integrarlo en Chrome como promete, la voz dejará de ser una curiosidad para convertirse en la forma más natural de interactuar con la web.
Fuentes verificadas
www.elnacional.com
www.elnacional.com
nokiapoweruser.com
nokiapoweruser.com