Dos personas hablan durante cuarenta minutos. Detienes la grabación, abres el archivo y ahí está: un bloque de texto donde “yo” y “ella” son las únicas pistas de quién dijo qué. Si alguna vez transcribiste una entrevista a mano, ya sabes que lo pesado no es escribir — es desenredar quién habla cada vez que la grabación retoma después de una pausa.
Y aquí está lo que casi nadie ha escrito todavía en español: Google le dio a Gemini la capacidad de hacer esto por ti, gratis, con etiquetas reales de hablante — “Hablante 1”, “Hablante 2” — y funciona sorprendentemente bien para una entrevista de dos personas. No es una beta. No hay lista de espera. Está ahí, en la app de Gemini, ahora mismo, mientras la mayoría de la gente que busca “cómo transcribir una entrevista” sigue cayendo en el muro de pago de Otter o en el cobro por minuto de Rev.
Esta es la guía de la opción gratis que nadie está cubriendo bien todavía. Vamos a caminar el proceso completo, te muestro un fragmento real de transcripción con etiquetas de hablante, la comparamos con honestidad contra Otter.ai, Rev y Descript — con lo que de verdad importa para alguien que paga en pesos, no en dólares — y te digo exactamente dónde se rompe. Porque sí se rompe, y fingir lo contrario solo te haría perder la tarde.
Qué es Gemini Transcribe (y por qué la cobertura en español todavía está a medias)
Google lanzó a fines de agosto de 2026 un modelo de voz a texto mejorado llamado Gemini 3.5 Transcribe, y ya está haciendo un trabajo silencioso en un montón de productos de Google que probablemente ya usas — la app de Gemini en tu celular, el dictado de Gboard, la escritura por voz de Google Docs. Detecta y transcribe automáticamente más de 85 idiomas, limpia muletillas si se lo pides y — esta es la parte que nos interesa — puede distinguir a los hablantes y ponerles etiqueta.
Nada de esto salió en los titulares como suele pasar con una nueva versión de Gemini. Se anunció junto a otras novedades de audio de Google la misma semana, así que la mayoría de la cobertura lo trató como una nota al pie: “Google también actualizó su modelo de transcripción”. Nadie escribió todavía la versión de esta historia que empieza con “grabas entrevistas para vivir y esto te cambia el martes”.
Ahora bien, en español la confusión es doble, y vale la pena aclararla antes de seguir. Xataka y enter.co ya cubrieron la función de subir audios a Gemini — pero describen la versión anterior, la general, que en su día llegó con un límite de apenas 10 minutos gratis por archivo. Infobae sí nombró correctamente a Gemini 3.5 Transcribe como modelo específico, con identificación de hablantes confirmada y una tasa de error de 2.6% en audio grabado — pero es una nota de anuncio de unos pocos párrafos, sin flujo de trabajo, sin claridad sobre los límites reales del plan gratis y sin comparación honesta contra las herramientas de pago. Si buscas esto en español ahora mismo, te vas a encontrar con un número de límite desactualizado o con un anuncio sin instrucciones. Nadie construyó todavía la guía completa de grabar, transcribir, verificar y publicar. Esa es la pieza que falta, y es la que estás leyendo.
Así que seamos claros sobre lo que en verdad estás recibiendo, porque “transcripción de IA gratis” ya nos decepcionó antes (te estoy mirando a ti, app que regala cinco minutos gratis y después pide la tarjeta). Gemini Transcribe, usado desde la app gratuita de Gemini o desde gemini.google.com, toma un archivo de audio o video, lo transcribe y — si se lo pides — separa a los hablantes. Sin suscripción. Sin bolsa de minutos que se reinicia cada mes. Ni siquiera te estás inscribiendo a una “prueba gratuita”.
El truco, porque siempre hay uno, es que no se construyó como un producto de transcripción dedicado. Es una IA de propósito general que resulta ser muy buena en esta tarea específica si le pides las cosas de la manera correcta. Esa es la razón de ser de esta guía — la “manera correcta” no es obvia, y hacerlo mal te quema la paciencia en una función que en realidad sí funciona.
Por qué esto le importa a un periodista en español, específicamente
La Sociedad Interamericana de Prensa (SIP) no eligió el tema de la IA por casualidad este año: su programa AI Product Lab, con apoyo de Google News Initiative, ya está trabajando con 21 medios de 12 países de América Latina para meter herramientas de IA dentro del flujo diario de redacción. O sea, esto no es una curiosidad de nicho — es exactamente el tipo de tarea (transcribir entrevistas, acelerar la verificación, liberar tiempo para el reporteo real) que ese programa está tratando de resolver a escala regional. Que la herramienta específica que mejor resuelve una parte de ese problema sea gratis y ya esté en tu celular es una noticia que, la verdad, nadie te está contando todavía.
El paso a paso: de la grabación a una transcripción limpia y con etiquetas
Voy a llevar un solo ejemplo hasta el final de esta guía, porque las instrucciones genéricas no sirven de nada en el momento en que tu audio real no se parece al del tutorial. Digamos que eres periodista freelance y acabas de grabar una llamada de 22 minutos con una fuente — llamémosla Camila, dueña de una tienda de barrio en Bogotá — sobre una nueva norma municipal que afecta a los pequeños comercios. Dos hablantes, tú haciendo la mayoría de las preguntas, audio de celular decente, algo de ruido de calle de fondo. Esto es prácticamente lo más normal que existe en audio de entrevista.
Paso 1: graba bien, o vas a pelear con la transcripción después
Antes de siquiera abrir Gemini, la calidad de tu grabación ya decidió qué tan buena va a ser tu transcripción. Unas cuantas cosas que importan más de lo que la gente cree:
- Usa un micrófono externo o de solapa si puedes. Un micrófono a 15-30 centímetros de la boca de alguien le gana por mucho a un celular tirado sobre la mesa. Si es una llamada, pídele a la otra persona que use audífonos con micrófono en vez del altavoz.
- Busca un cuarto silencioso, sin superficies duras. El eco de un piso de cerámica o de un vidrio confunde más la separación de hablantes de lo que uno pensaría — el modelo tiene que distinguir las voces por su patrón acústico, y la reverberación borronea ese patrón.
- Que cada persona diga su nombre al inicio. “Hola, soy Camila”, “Y yo soy [tu nombre]” — treinta segundos de esto anclan las etiquetas antes de que arranque la conversación real.
- Que hable una persona a la vez. Hablar al mismo tiempo es, sin discusión, la causa número uno de una mala diarización (el término técnico para “descubrir quién dijo qué”). Más abajo te explico por qué.
- Graba un respaldo. Una nota de voz del celular corriendo en paralelo a tu grabadora principal no te cuesta nada y te salva cuando la principal falla. Pasa más seguido de lo que cualquiera admite.
Nada de esto es específico de Gemini — es el mismo consejo que te daría un transcriptor con años de oficio, desde antes de que existieran los celulares inteligentes. La IA no eliminó la necesidad de tener buen material de origen. Solo hizo que el mal material perdonara un poco más de lo que solía perdonar.
Paso 2: sube el archivo a Gemini
Entra a gemini.google.com (o abre la app de Gemini) y arranca un chat nuevo. Haz clic en el ícono de adjuntar y sube tu archivo de audio o video. Gemini maneja sin problema formatos comunes como MP3, M4A y WAV, y el video también funciona si tu “grabación” en realidad fue una llamada de Zoom.
Un número que conviene tener claro antes de subir el archivo: la duración importa más que el peso del archivo. La documentación de Google para el modelo de fondo pone el techo de procesamiento estándar en alrededor de una hora, pero ese techo baja a unos 30 minutos específicamente cuando pides etiquetas de hablante o marcas de tiempo por palabra — que, para lo que nos interesa acá, siempre estamos pidiendo. Si tu entrevista es larga, planea dividirla en fragmentos de menos de 30 minutos en lugar de subir todo el archivo y esperar lo mejor.
Ojo con esto porque es justo donde la cobertura en español se quedó atrás: si viste el artículo de Laboratorio de Periodismo o el de enter.co sobre el Gemini genérico, ambos hablan de un límite de 10 minutos en el plan gratis — y ese número es real, pero corresponde a la función anterior de “subir audio” del chat normal, no al modelo Gemini 3.5 Transcribe cuando le pides diarización explícita. En la práctica, la diferencia entre 10 minutos y 30 minutos es la diferencia entre tener que cortar tu entrevista en tres pedazos o en uno solo.
Paso 3: pide exactamente lo que quieres (acá es donde todo el mundo se equivoca)
Este es el error que hace que la gente abandone este método después de un solo intento: suben el archivo y escriben “transcribe esto”. Gemini lo va a hacer — pero por defecto puede limpiar el texto y convertirlo en prosa legible sin etiquetas de hablante, o etiquetar a los hablantes de forma inconsistente si no se lo pides con precisión. Tienes que ser explícito. Este es el prompt que de verdad funciona:
Transcribe este audio de forma literal, palabra por palabra,
incluyendo muletillas. Etiqueta a cada hablante como "Hablante 1"
y "Hablante 2" según su voz, y empieza una línea nueva cada vez
que cambie el hablante. Incluye una marca de tiempo aproximada
cada vez que cambie el hablante.
Esa palabra “literal” está haciendo trabajo de verdad. Gemini puede correr en un modo “inteligente” limpio que elimina los “eh” y los inicios en falso para que el texto sea más legible — lo cual es útil de verdad para otras cosas, como convertir una nota de voz en un apunte prolijo. Pero el modo inteligente y el etiquetado de hablantes no se llevan bien en la versión actual; la diarización solo se activa de forma confiable cuando pides la versión cruda, sin pulir. Pide la versión literal primero. Límpiala después, como un paso aparte, una vez que ya tengas asegurado el mapa de quién es quién.
Paso 4: lo que en verdad te devuelve
Acá tienes un fragmento representativo de esa entrevista con Camila — reconstruido para mostrarte exactamente cómo se ve el formato de salida, etiquetas incluidas:
[00:00] Hablante 1: Bueno, muchas gracias otra vez por sacar el
tiempo. ¿Me puedes contar hace cuánto tienes la tienda?
[00:04] Hablante 2: Sí, claro. Pues abrimos en, eh, 2019, justo
antes de, bueno, antes de que pasara todo. Así que ya van —
seis años, creo, que suena raro decirlo en voz alta.
[00:19] Hablante 1: ¿Y cuándo te enteraste de la norma nueva
que están proponiendo?
[00:22] Hablante 2: ¿Honestamente? Me enteré por una clienta
antes de que me llegara algo de la alcaldía. Lo cual, o sea,
ya te dice algo. Me enteré por un volante que trajo alguien,
y después tuve que ponerme a buscar la norma yo misma porque
nadie de la alcaldía llamó directamente.
[00:41] Hablante 1: ¿Qué sentiste cuando la leíste?
[00:43] Hablante 2: Yo estaba — a ver, siendo honesta, estaba
bastante molesta. Porque el retiro que piden vuelve mi
estacionamiento actual no permitido, y nadie explicó qué
significa eso para los negocios que ya estaban ahí antes.
Fíjate qué captó: muletillas conservadas (“eh”, “creo”), un inicio en falso y su autocorrección bien registrados (“antes de, bueno, antes de”), una pausa representada de forma natural con una raya, y — el punto central de todo esto — atribución de hablante correcta y consistente a lo largo de cuatro intercambios sin un solo error de etiqueta. Para una grabación limpia de dos personas como esta, eso está realmente cerca de lo que te entregaría un transcriptor profesional.
Paso 5: limpia el texto
Una vez que tienes un borrador literal y etiquetado por hablante, decide cuánta limpieza necesitas de verdad. Para un texto de notas de podcast, capaz quieres quitar las muletillas — pega la versión literal en un prompt nuevo y pídele a Gemini que “limpie las muletillas y los inicios en falso pero mantenga el significado y la estructura exactamente igual”. Para una entrevista de investigación que va a terminar en una herramienta de codificación como NVivo o Dedoose, probablemente quieras conservarla literal, porque el tono y las dudas a veces son datos.
De cualquier forma, haz una pasada más tú mismo: escucha a 1.25x-1.5x de velocidad mientras lees, cazando lo que “suena bien” al oído pero se lee mal en la página. Esto no es tarea de relleno opcional — es el mismo paso de verificación que recomienda cualquier guía de transcripción, con IA o sin ella, porque incluso una transcripción con más de 95% de exactitud todavía tiene ese 5% escondido en algún lado, casi siempre en un nombre propio o un número.
Paso 6: exporta el resultado
No hay un botón de “exportar como .docx” — Gemini es una interfaz de chat, no una app de transcripción dedicada. Selecciona todo, copia, y pega en un Google Doc o un archivo de Word. Si estás sacando citas para un artículo, este también es el momento de marcar con tiempo tus mejores frases en un apunte de trabajo aparte, para no tener que releer toda la transcripción después buscando esa frase perfecta.
Gemini Transcribe vs. Otter, Rev y Descript: la comparación honesta
Esta es la tabla que la mayoría de los resultados de búsqueda para “transcribir audio a texto gratis” no te va a mostrar, porque casi todo lo que rankea para esa búsqueda lo escriben las mismas herramientas, o afiliados a quienes les pagan por recomendarlas. Así se ven los números de verdad, según lo que cada proveedor tenía publicado en agosto de 2026.
| Gemini Transcribe (gratis) | Otter.ai (plan gratis) | Rev (plan gratis) | Descript (plan gratis) | |
|---|---|---|---|---|
| Minutos gratis al mes | Sin límite mensual* | 300 min/mes | 45 min/mes | 60 min/mes |
| Límite por archivo | ~30 min con etiquetas de hablante | 30 min por conversación | Sin límite específico | Sin límite específico |
| Tope de importaciones de por vida | Ninguno | 3 archivos importados, para siempre | No especificado | 100 créditos de IA (uso único) |
| Etiquetas de hablante en el plan gratis | Sí | Sí | Sí | Sí |
| Idiomas | 85+ | Enfocado en inglés | Solo inglés (plan gratis) | Enfocado en inglés |
| Opción de transcripción humana | No | No | Sí, desde US$1.99/min | No |
| Plan pago más barato | ~US$0.005/min vía API | US$8.33/mes (anual) | US$25.49/mes | US$16/mes (anual) |
| Uso de tus datos para entrenar IA por defecto | Sí, en cuentas de consumidor | Depende de la política del proveedor | Depende de la política del proveedor | Depende de la política del proveedor |
| Pensado para | Asistente de IA general | Transcripción de reuniones/entrevistas | Transcripción legal y profesional | Edición de audio/video basada en texto |
*En la práctica es prácticamente ilimitado mes a mes, pero cada archivo individual tiene que estar bajo unos 30 minutos si quieres etiquetas de hablante — así que una entrevista larga significa dividirla en partes, no subirla entera de un solo tirón.
Hay algo que vale la pena decir sin rodeos en vez de esconderlo en la tabla: ninguna de estas tres herramientas de pago factura en pesos, soles o el peso que uses en tu país. Todo se cobra en dólares, a la tarjeta internacional, y en un año donde el dólar sube y baja como sube y baja en buena parte de América Latina, un plan de US$25.49 al mes de Rev no es un número fijo — es un número que cambia según el día en que te cobran. Eso convierte a “es gratis y no tienes que preocuparte por el tipo de cambio” en una ventaja de Gemini que ninguna comparación hecha desde Estados Unidos va a mencionar, porque para ellos ni siquiera es un problema.
Los 300 minutos gratis de Otter suenan generosos hasta que lees la letra chica: solo tres importaciones de archivo de por vida en el plan gratis — para siempre, no por mes. Si transcribes más de tres entrevistas ya grabadas en total, o pagas o buscas otra herramienta, sin importar cuántos de tus 300 minutos te queden. El plan gratis de Rev es el más flaco en volumen (45 minutos, solo en inglés), porque el negocio real de Rev es la transcripción humana y profesional que arranca cerca de dos dólares por minuto — el plan gratis con IA es una probadita, no un flujo de trabajo de verdad. El plan gratis de Descript es genuinamente bueno si estás editando estilo podcast, cortando audio al borrar texto, pero sus créditos de IA para funciones de limpieza son de uso único, no mensuales.
La ventaja real de Gemini no es que sea más exacto que cualquiera de estos — todavía no existen comparaciones independientes, uno a uno, que enfrenten a Gemini 3.5 Transcribe contra Otter, Rev o Descript sobre el mismo audio, y cada número de tasa de error que publica cada proveedor sale de su propio set de pruebas. Google reporta alrededor de 2.6% de tasa de error en audio grabado y limpio, lo cual es competitivo dentro del campo, pero “competitivo” y “definitivamente mejor” son afirmaciones distintas, y nadie debería decirte lo contrario con cara seria. La ventaja real de Gemini es que no cuesta nada, no tiene tope de importaciones, y lo más probable es que ya tengas la cuenta.
La contrapartida honesta está en otro lado por completo: la privacidad de tus datos. Lee la siguiente sección antes de subir cualquier cosa sensible.
Qué significa esto para ti: 7 perfiles de lector
Si eres periodista freelance con entrega en la mira. Úsalo para entrevistas rutinarias y no sensibles, donde la velocidad importa más que una confidencialidad perfecta — un candidato a un concejo, un vocero de una empresa, cualquiera a quien no le importe que su grabación haya pasado por los servidores de Google. La cuenta es simple: una entrevista telefónica de 25 minutos que antes te comía una hora de la noche, ahora te toma diez minutos entre subir y revisar — y esa hora que recuperas es para escribir de verdad. Tu primera acción: antes de tu próxima entrevista, prueba el prompt de literal + etiquetas de hablante con una grabación de dos minutos tuya y de un colega, para no aprender el flujo en vivo el mismo día de la entrega.
Si eres podcaster armando las notas del episodio. Este es casi el caso perfecto — dos o tres hablantes, audio de estudio decente, sin problemas de confidencialidad. Pide primero la versión literal para fijar bien las etiquetas de hablante, y después corre una segunda pasada de limpieza para sacar las muletillas antes de publicar tus notas o el resumen del blog. Si publicas transcripciones completas del episodio para SEO (una práctica que de verdad vale la pena, porque las transcripciones se indexan y se buscan), este flujo te lleva ahí sin la factura mensual de Otter o Descript comiéndose los ingresos de publicidad de un show que todavía no se monetiza. Tu primera acción: transcribe el audio crudo de tu próximo episodio antes de editarlo, así puedes sacar tus mejores frases para redes mientras el episodio todavía está fresco.
Si eres investigador o investigadora de UX haciendo entrevistas de usuario. Ten cuidado acá — los participantes suelen contar cosas asumiendo una confidencialidad que la política de privacidad de tu empresa o de tu comité de ética promete proteger, y el plan de consumidor de Gemini tiene por defecto revisión humana y uso en el entrenamiento del modelo. Esto no es razón para evitar la transcripción con IA por completo; es razón para revisar qué cuenta estás usando antes de arrancar. Tu primera acción: revisa si tu organización tiene una cuenta de Google Workspace con garantías de exclusión de entrenamiento antes de subir una sola grabación de un participante a una cuenta personal de Gemini — la diferencia entre una cuenta personal y una de Workspace es la diferencia entre “revisado por un contratista” y “excluido de revisión por contrato”.
Si eres estudiante de posgrado haciendo entrevistas de investigación cualitativa. Misma precaución de privacidad que arriba, pero más fuerte todavía — los protocolos de los comités de ética de investigación suelen especificar con precisión cómo se deben guardar las grabaciones y transcripciones, y “lo subí a una herramienta de IA de consumidor gratis” difícilmente va a ser un lenguaje pre-aprobado en tu apartado de metodología. Dicho esto, para entrevistas que no cargan ningún riesgo de confidencialidad (figuras públicas, entrevistas a expertos ya hechas para el registro), esto puede ahorrarte semanas de transcripción manual en una tesis con más de 20 entrevistas. Tu primera acción: pregúntale directamente a tu comité de ética o a tu director de tesis si el manejo de datos de Gemini cumple con los requisitos de tu protocolo antes de apoyarte en esto para una sola entrevista, y consigue la respuesta por escrito.
Si trabajas en Recursos Humanos haciendo entrevistas de salida. No uses el Gemini de consumidor para esto. Punto. Las entrevistas de salida traen de rutina detalles de compensación, denuncias de acoso y otro material que tu área legal no querría ver sentado en la base de entrenamiento de un tercero o revisado por un contratista humano — el riesgo acá le gana por mucho al tiempo que ahorras. Tu primera acción: si tu empresa tiene Google Workspace Enterprise, confirma los términos contractuales de no entrenamiento antes de siquiera considerarlo — de lo contrario, usa un proveedor de transcripción dedicado y compatible con las políticas de RR.HH., construido justo para este tipo de responsabilidad legal.
Si haces documentales y estás en la etapa de preparación de entrevistas. Buen caso de uso para un registro de borrador rápido — no vas a publicar la transcripción cruda, la vas a usar para encontrar en cuál de tus seis horas de material está la frase que necesitas, rápido, sin pagar por minuto sobre metraje que en su mayoría va a terminar en la sala de edición sin usarse. Una vez que identificaste tus momentos clave en la transcripción gratuita, puedes mandar solo esos clips a un servicio pago y certificado si necesitas exactitud de nivel transmisión para el corte final. Tu primera acción: corre primero tu entrevista más larga y desordenada (la que tiene cruce de voces o un acento que te preocupa) para ver exactamente dónde falla antes de confiar en ella para el resto de tu material.
Si trabajas en una organización sin fines de lucro haciendo historia oral. Esto depende por completo de qué les prometiste a tus entrevistados sobre confidencialidad — los proyectos de historia oral con adultos mayores de la comunidad o sobrevivientes de trauma suelen cargar compromisos explícitos de privacidad que la política de datos por defecto de una herramienta de IA de consumidor violaría, y esa confianza, una vez rota, no vuelve. Para proyectos donde los participantes ya dieron consentimiento amplio para archivo público (un proyecto de historia comunitaria pensado para una biblioteca pública, por ejemplo), la cuenta cambia por completo, y la transcripción gratis significa que puedes darte el lujo de grabar y preservar muchas más historias de las que un presupuesto por minuto te permitiría. Tu primera acción: consigue un consentimiento informado que nombre específicamente la herramienta de transcripción y su política de datos, o no la uses para ese proyecto.
Casos límite y solución de problemas
Ruido de fondo o ambiente ruidoso. Gemini maneja razonablemente bien el ruido moderado — está pensado explícitamente para funcionar en “ambientes ruidosos”, según el propio material de Google — pero el ruido fuerte sigue degradando tanto la exactitud de las palabras como la separación de hablantes. Solución: si tienes algo de control sobre el ambiente de grabación, úsalo. Después de grabado, no hay mucho que hacer salvo una pasada manual de limpieza sobre las secciones más ruidosas.
Hablantes que se superponen (cruce de voces). Esta es, en cualquier herramienta, con IA o sin ella, la causa número uno de errores de transcripción, y Gemini no es la excepción. Cuando dos personas hablan al mismo tiempo, el modelo tiene que adivinar, y suele fusionar el habla en la línea de un solo hablante o directamente perder palabras. Solución: esto se resuelve al momento de grabar — establece la norma de “dejar terminar” antes de arrancar, sobre todo en una entrevista de ida y vuelta muy viva.
Más de tres hablantes. La propia documentación de Google marca la atribución de hablantes como “experimental” a partir de tres voces, aunque el tope técnico listado es ocho. Un panel o una discusión grupal es donde vas a ver que las etiquetas empiezan a desviarse — el Hablante 2 se convierte en Hablante 3 a mitad de camino. Solución: para entrevistas grupales, pide que cada persona diga su nombre varias veces durante la grabación, no solo al inicio, y espera hacer más corrección manual.
Acentos marcados o variantes regionales del español. Acá el español tiene una particularidad que el inglés no tiene de la misma forma: veinte países, veinte acentos, y una variación real entre el español rioplatense, el caribeño, el andino y el mexicano que va mucho más allá de “acento marcado”. Google dice que soporta acentos y dialectos regionales como parte de su cobertura de 85+ idiomas, y de verdad se defiende mejor acá que la mayoría de las herramientas de hace un par de años. Pero las pruebas del mundo real desde el lanzamiento muestran zonas ásperas — el cambio de código entre idiomas a mitad de frase (spanglish real, no el que usamos en este blog para hablar de tecnología, sino el que se habla en Miami o en la frontera con Estados Unidos) ha producido palabras confusas o perdidas en reportes tempranos. Solución: si tu entrevistado mezcla idiomas de forma habitual, especifica ambos idiomas en tu prompt en lugar de confiar en la detección automática.
Archivos largos que se cortan solos. Algunos usuarios tempranos reportaron subir un archivo de 20 minutos y recibir una transcripción que misteriosamente se detiene en el minuto 5, sobre todo cuando la diarización está activada. Solución: divide cualquier cosa de más de 20-25 minutos en partes antes de subirla, y siempre baja hasta el final del resultado para confirmar que de verdad cubre toda la grabación antes de confiar en ella.
Audio en un idioma que no es español ni inglés. La cobertura entre los 85+ idiomas soportados no es pareja — algunos usuarios que compararon Gemini contra herramientas especializadas en un idioma específico (como Soniox para japonés) encontraron que la herramienta especializada era más rápida y exacta en habla rápida e informal en ese idioma. Solución: para idiomas distintos del español o el inglés, haz una prueba corta antes de meter toda tu entrevista, y ten a mano una alternativa especializada por si el resultado decepciona.
Hablantes mal atribuidos. Incluso en un audio limpio de dos personas, alguna línea ocasional se le asigna al hablante equivocado, casi siempre justo después de una pausa larga o de una interjección muy corta como “claro” o “ajá”. Solución: justo para eso sirve el paso de verificación del Paso 5 — lee mientras escuchas, y corrige los errores de etiqueta a medida que avanzas.
Subir el archivo por la interfaz equivocada. Un puñado de reportes de perfil más técnico encontraron que enrutar el audio a través de ciertas herramientas de terceros construidas sobre Gemini a veces manda el archivo a un modelo de chat general en lugar del modelo dedicado de transcripción, produciendo peores resultados (nombres de empresa mal entendidos, nombres propios confusos) que subir directo por gemini.google.com o la app de Gemini. Solución: para todo lo que de verdad importe, usa la app o el sitio oficial de Gemini directamente, no un intermediario de terceros.
Jerga técnica o nombres propios poco comunes. Si tu entrevista está llena de términos específicos de una industria, nombres de producto o formas poco comunes de deletrear el nombre de una persona, espera algunos errores en la primera pasada — el modelo está adivinando la escritura según cómo suena algo, igual que haría un transcriptor humano que no conoce tu campo. Solución: menciona los nombres o términos poco comunes en tu prompt antes de transcribir (“la empresa se llama Duskr, se escribe D-U-S-K-R”), o pídele a tu entrevistado que deletree cualquier cosa poco común dentro de la propia grabación.
Calidad de audio de llamada telefónica. El audio comprimido de una llamada, sobre todo con conexión intermitente, es un insumo más difícil que una grabación digital limpia, y eso se nota más en la separación de hablantes que en la exactitud pura de las palabras — el audio con ruido de fondo hace que dos voces suenen más parecidas entre sí de lo que en verdad son. Solución: cuando puedas, graba las entrevistas telefónicas con un servicio que capture a cada participante en una pista separada (muchas apps de grabación de llamadas para periodistas hacen esto) en lugar de una sola grabación fusionada de la línea telefónica.
Lo que no puede hacer
Seamos directos con los límites, porque una guía que solo te cuenta las buenas noticias no vale tu tiempo.
No es subtitulado en tiempo real para una conversación que estás teniendo ahora mismo — al menos no a través de este flujo de consumidor. Gemini tiene un modo de transmisión en vivo separado, pensado para desarrolladores, pero la versión de la app gratuita que va a usar la mayoría de la gente es de “subir y después transcribir”, no de subtitulado simultáneo.
No produce una transcripción certificada de nivel legal. Si necesitas una transcripción que aguante en un juicio o que cumpla un requisito de certificación, eso es literalmente el modelo de negocio de Rev (transcripción humana, exactitud jurada) — no una herramienta de IA gratuita de consumidor, y nadie debería fingir lo contrario.
No va a manejar de forma confiable mucho cruce de voces o conversaciones grupales grandes. Como ya vimos, esto se degrada rápido después de dos o tres hablantes claros, y no hay ninguna configuración que lo arregle — es un límite estructural de cómo funciona hoy la diarización.
No es una herramienta con privacidad garantizada para material sensible. En una cuenta personal de Google, lo que hay por defecto es revisión humana y uso en el entrenamiento del modelo. Esto no es una trampa escondida — Google lo dice abiertamente — pero es la limitación más importante para cualquiera que esté transcribiendo entrevistas confidenciales con una fuente, sesiones terapéuticas o cualquier cosa cubierta por una promesa de confidencialidad.
No te va a dar un documento con formato final. Recibes texto dentro de una ventana de chat. Convertir eso en una transcripción prolija, con encabezados, marcas de tiempo y estilo prolijo, sigue siendo cosa tuya — o un prompt aparte pidiéndole a Gemini que reformatee lo que ya te dio.
Preguntas frecuentes
¿Gemini Transcribe es de verdad gratis, o hay un truco escondido? Es gratis usarlo desde la app de Gemini y desde gemini.google.com con una cuenta normal de Google — sin suscripción, sin bolsa de minutos. El “truco” es en realidad una contrapartida: tu audio puede ser revisado por personas y usado para entrenar los modelos de Google por defecto, lo cual importa mucho para entrevistas sensibles y casi nada para las rutinarias.
¿A cuántos hablantes puede distinguir? La documentación de Google lista soporte para hasta 8 hablantes, pero marca explícitamente la atribución de 3 o más como “experimental”. En la práctica, es más confiable con dos hablantes y se vuelve notablemente más inestable después de tres.
¿Puedo obtener una transcripción sin etiquetas de hablante, solo texto limpio? Sí — de hecho ese es el comportamiento por defecto si no pides específicamente la versión literal con etiquetas. Solo pídele a Gemini que “limpie esto y lo convierta en texto legible” en lugar del prompt literal de más arriba.
¿Funciona con archivos de video, no solo audio? Sí. Sube un video igual que subirías un audio — una grabación de Zoom, un video de celular de una entrevista presencial — y Gemini va a transcribir la pista de audio hablado.
¿Qué pasa si mi entrevista dura más de 30 minutos? Divídela en partes de menos de 30 minutos cada una antes de subirla si quieres etiquetas de hablante o marcas de tiempo incluidas. La transcripción estándar sin esas funciones puede manejar hasta cerca de una hora en un solo archivo.
¿Esto es mejor que Otter o Rev? “Mejor” depende de qué estés optimizando. Es gratis y sin tope de importaciones, algo que ni el plan gratis de Otter ni el de Rev pueden igualar. No es necesariamente más exacto — todavía no existe una comparación independiente que los haya enfrentado directamente sobre el mismo audio — y no ofrece la opción de transcripción humana de Rev para exactitud de nivel legal.
¿Puedo confiarle una entrevista confidencial con una fuente? No en una cuenta personal de Google, no sin desactivar explícitamente el historial de actividad de Apps de Gemini o usar primero un chat temporal, y aun así, entiende que Google declara que retiene algunos datos por una ventana corta de todos modos. Para material genuinamente sensible, trátalo igual que cualquier herramienta en la nube: asume que no es privada hasta que confirmes lo contrario.
¿Cuesta algo si lo uso desde la API en vez de la app? Sí, si eres desarrollador construyendo sobre la API en lugar de usar la app de consumidor — el precio ronda medio centavo de dólar por minuto para procesamiento estándar. Los usuarios normales que entran por gemini.google.com o la app de Gemini no pagan nada.
¿Qué formatos de audio acepta? Formatos comunes como MP3, M4A y WAV funcionan sin problema, junto con formatos de video estándar si estás subiendo una llamada grabada o una entrevista en video.
¿Necesito pagar Gemini Advanced o alguna suscripción Pro para usar esto? No. Esto funciona con una cuenta de Google normal y gratuita, desde la app estándar de Gemini y gemini.google.com — no se necesita Gemini Advanced ni Google One AI Premium para la función de transcripción en sí.
¿Sirve para una clase, un panel o una reunión grupal? Va a producir una transcripción, pero trata las etiquetas de hablante con escepticismo después de dos o tres voces — la propia documentación de Google llama “experimental” a la atribución de 3 o más hablantes, y en la práctica, los paneles y las reuniones de varias personas son justo donde más aparece el error de etiqueta. Para una clase de un solo orador, la exactitud de la transcripción se sostiene bien porque no hay ningún problema de diarización que resolver.
Conclusión
Las herramientas de transcripción pagas no están equivocadas al decir que una transcripción con etiquetas de hablante vale la pena pagarla — solo dejaron de ser el único lugar donde conseguir una. Si tus entrevistas son rutinarias, tu audio es razonablemente limpio y no estás sentado sobre algo que necesita confidencialidad blindada, Gemini te va a dar una transcripción genuinamente usable, gratis, y lo va a hacer más rápido que escribir “cómo transcribir una entrevista” en un buscador y pasar por tres páginas de precios antes de decidirte.
Si haces este tipo de trabajo con regularidad — sacarle sustancia a una conversación, ordenar lo que la gente te cuenta en algo usable — eso es una habilidad que va mucho más allá de una sola herramienta gratis. Nuestro curso de Periodismo Digital con IA recorre cómo estructurar el trabajo de reporteo con IA de principio a fin, incluyendo la verificación de lo que la propia IA te entrega, y nuestro curso de Preparación de Entrevistas con IA cubre cómo llegar a la entrevista con las preguntas correctas ya armadas, para que la transcripción que consigas después valga la pena leer.
Fuentes
- Laboratorio de Periodismo Luca de Tena — Gemini incorpora transcripción de audios: implicaciones para periodistas y publishers
- Xataka Móvil — No tardas ni diez segundos: convierte audio a texto sin apps extra con Gemini
- enter.co — Gemini ya permite transcribir audios gratis desde el celular o la web
- Infobae — Google lanzó Gemini 3.5 Transcribe: pasa más de 85 idiomas a texto entendiendo palabras difíciles y acentos
- SIP — Programa de la SIP apoyado por Google impulsa la adopción de IA en 21 medios de América Latina
- Google — Intelligent transcription with Gemini 3.5 Transcribe
- Google AI for Developers — Documentación del modelo Gemini 3.5 Transcribe
- Google AI for Developers — Guía de transcripción de audio
- Google AI for Developers — Precios de la API de Gemini
- Google — Centro de privacidad de Gemini Apps
- Otter.ai — Precios
- Rev — Planes de suscripción y precios por minuto
- Descript — Precios
- 9to5Google — Google launches Gemini 3.5 Transcribe