Skip to content

Audio a texto: gratis, privado y en tu navegador

Model

Suelta un archivo aquí — pega, arrastra o haz clic para explorar

.mp3,.m4a,.aac,.wav,.ogg,.opus,.flac

Procesado en tu dispositivo: no se sube nada. Verifícalo en la pestaña de red.

Esta herramienta convierte el audio hablado en texto sin enviar tu grabación a ningún lado. Cuando sueltas un archivo, un modelo de reconocimiento de voz —de la misma familia que Whisper de OpenAI— se descarga a tu navegador una vez y hace todo el trabajo en tu propia máquina. Nada se sube, no hay cuenta y puedes verlo suceder: abre la pestaña de red de tu navegador y verás que el audio nunca sale de la página.

Ese diseño en el navegador es la clave de todo. La mayoría de los sitios gratuitos de transcripción envían tu audio a un servidor, lo que significa que la infraestructura de un desconocido guarda una copia de lo que sea que grabaste: una entrevista, una sesión de terapia, una llamada confidencial. Aquí el audio se queda en tu dispositivo de principio a fin, así que la promesa de privacidad no es algo en lo que tengas que confiar, es la forma en que está construido el software.

Obtienes funciones de transcripción de verdad, no una demo recortada: detección automática de idioma en unos 100 idiomas, marcas de tiempo a nivel de palabra y exportación a texto plano, SRT o VTT. Maneja los formatos comunes —MP3, M4A, WAV y más— y también trabaja sobre la pista de audio dentro de archivos de video.

Cómo funciona

  1. 01

    Suelta tu archivo de audio

    Arrastra un MP3, M4A, WAV u otro archivo de audio a la página, o haz clic para buscarlo. El archivo lo lee directamente tu navegador y nunca se sube a un servidor: puedes confirmarlo en la pestaña de red.

  2. 02

    Elige un modelo y comienza

    Elige un nivel de velocidad frente a precisión (un modelo rápido de ~40MB o uno más grande y preciso). El modelo se descarga una vez, queda en caché para la próxima y transcribe en tu dispositivo. El idioma se detecta automáticamente, o puedes fijarlo.

  3. 03

    Revisa las marcas de tiempo y exporta

    Lee la transcripción con sus marcas de tiempo, haz los ajustes que quieras y descárgala como TXT para un guion limpio o SRT/VTT para subtítulos. Todo se queda local, así que nada se almacena ni se envía cuando guardas.

Cómo funciona la transcripción en el navegador

Cuando cargas esta página, todavía no se descarga ningún modelo: la página se mantiene ligera. En el momento en que eliges un archivo y comienzas, la herramienta obtiene un modelo de reconocimiento de voz y lo ejecuta dentro de un proceso en segundo plano en tu navegador, usando la GPU de tu dispositivo a través de WebGPU donde está disponible y recurriendo a un camino por CPU (WASM) en los navegadores que lo necesitan, como Safari.

El audio se decodifica a muestras en bruto, se divide en fragmentos manejables para grabaciones largas y se pasa por el modelo para producir texto con sincronización. Todo ese cálculo ocurre en tu hardware. La primera ejecución de un modelo dado incluye una descarga única; después de eso el modelo queda en caché, así que las transcripciones repetidas empiezan casi de inmediato, incluso sin conexión.

Elegir un modelo: velocidad frente a precisión

Hay un verdadero equilibrio entre qué tan rápido llega una transcripción y qué tan precisa es, así que la herramienta ofrece niveles en lugar de decidir por ti:

  • Rápido (~40MB): se descarga en segundos, funciona bien en teléfonos y laptops modestas, y sirve para voz clara y borradores rápidos.
  • Equilibrado: una descarga más grande con un manejo notablemente mejor de acentos, voces superpuestas y ruido de fondo; una buena opción por defecto para entrevistas y reuniones.
  • Calidad (~530MB, opcional): el nivel más preciso, que vale la descarga única más grande cuando la calidad de la transcripción importa más que la velocidad. Es opcional precisamente porque medio gigabyte no es algo que debas descargar en silencio.

Como todo se ejecuta localmente, una máquina más rápida simplemente termina antes: no hay cola ni límite por minuto.

Idiomas, marcas de tiempo y exportación de subtítulos

El modelo admite alrededor de 100 idiomas y detecta el idioma hablado automáticamente, así que puedes soltar audio en francés, hindi, español o árabe sin cambiar ningún ajuste. Si la detección alguna vez falla en un clip corto o ruidoso, puedes fijar el idioma a mano.

Cada transcripción viene con marcas de tiempo, que es lo que hace útiles las exportaciones de subtítulos. Guarda como SRT o VTT y obtienes subtítulos con tiempos correctos, listos para un editor de video, YouTube o un reproductor. Guarda como TXT cuando solo quieras las palabras: la transcripción de una entrevista, apuntes de una reunión o una copia buscable de una clase. Los formatos de subtítulos y el texto plano salen todos del mismo resultado con tiempos, así que puedes exportar más de uno sin volver a ejecutar nada.

Para qué sirve esta herramienta

Está hecha para las tareas cotidianas que la gente realmente necesita resolver: convertir entrevistas y podcasts en texto buscable, redactar el acta de una reunión a partir de una grabación, subtitular un video, transcribir notas de voz o hacer legible y citable un archivo de audio viejo.

No es una herramienta de dictado en vivo: transcribes archivos que ya tienes, no un micrófono en tiempo real. Y como el modelo se ejecuta en tu dispositivo, las grabaciones extremadamente largas tardarán más en una máquina lenta y usarán más memoria. Para la mayoría de los archivos eso no es un problema; para audio de varias horas, una laptop lo maneja con más comodidad que un teléfono.

Preguntas frecuentes

¿Este convertidor de audio a texto es realmente gratis?
Sí. La transcripción en el navegador es ilimitada y gratuita, sin registro y sin marca de agua en tu texto. Como el trabajo se ejecuta en tu propio dispositivo en lugar de en nuestros servidores, no hay un costo por minuto que tengamos que trasladarte. Puedes transcribir tantos archivos como quieras y exportar a TXT, SRT o VTT sin ningún cargo.
¿Mi audio se sube a un servidor?
No. Tu audio se lee y se transcribe por completo dentro de tu navegador, y el archivo nunca sale de tu dispositivo. Lo único que se descarga es el propio modelo de reconocimiento de voz, una sola vez. Puedes verificar todo esto abriendo las herramientas de desarrollo de tu navegador y observando la pestaña de red mientras transcribes: el audio simplemente no se envía a ningún lado.
¿Qué formatos de audio puedo transcribir?
Los formatos comunes, incluidos MP3, M4A (AAC), WAV y otros, son compatibles, y la herramienta también puede extraer la pista de audio de archivos de video. El formato y la tasa de bits rara vez importan para el reconocimiento de voz: una nota de voz comprimida se transcribe casi tan bien como un archivo de estudio sin comprimir, porque la voz está en un rango de frecuencias que sobrevive bien a la compresión.
¿Qué tan precisa es la transcripción?
La precisión depende del nivel de modelo que elijas y del audio en sí. La voz clara con un solo hablante se transcribe muy bien; los acentos marcados, las voces superpuestas y el ruido de fondo son más difíciles. El modelo de calidad más grande y opcional maneja el audio difícil notablemente mejor que el nivel rápido. Para cualquier transcripción importante, cuenta con revisar por encima y corregir un poco el resultado.
¿Qué idiomas son compatibles?
El modelo cubre alrededor de 100 idiomas y detecta el idioma hablado automáticamente, así que normalmente no fijas nada. Transcribe en el idioma original en lugar de traducir. Si la detección automática se equivoca en un clip corto o ruidoso, puedes elegir el idioma manualmente antes de comenzar para orientarla correctamente.
¿Puedo obtener marcas de tiempo o subtítulos?
Sí. Cada transcripción incluye marcas de tiempo, y puedes exportar directamente a archivos de subtítulos SRT o VTT con tiempos correctos, o a TXT plano cuando solo quieras las palabras. Los tres salen del mismo resultado con tiempos, así que puedes guardar la transcripción una vez como texto y otra como subtítulos sin transcribir el archivo por segunda vez.
¿Funciona sin conexión?
Después de la primera ejecución, en gran medida sí. El modelo de voz queda en caché en tu navegador, así que una vez descargado puedes transcribir más tarde incluso sin conexión. La primera transcripción con un modelo dado necesita estar en línea para obtener ese modelo, pero las ejecuciones posteriores reutilizan la copia en caché y no la vuelven a descargar.
¿Hay un límite en la duración del archivo?
No hay un límite fijo que impongamos: las grabaciones largas se dividen en fragmentos y se procesan en secuencia. El límite práctico es tu dispositivo: el audio muy largo o de alta resolución requiere más tiempo y memoria, así que una laptop maneja archivos de varias horas con más comodidad que un teléfono. Para la mayoría de las entrevistas y reuniones, la duración no es un problema.