Transcripción y dictado gratis en tu ordenador: Whisper en local, sin internet

Cómo funciona la transcripción con modelos locales, qué ordenador hace falta de verdad, cuánto cuesta frente a los servicios por minuto y qué pierdes al no usar la nube.

FounderPublicado

Los servicios de transcripción cobran por minuto de audio. Los de dictado, por suscripción mensual. Y los dos tienen en común algo que casi nunca se discute: para funcionar, tu voz tiene que salir de tu ordenador y llegar a un servidor ajeno.

Existe otra forma. Whisper, el modelo de transcripción de OpenAI, se publicó bajo licencia MIT y se puede ejecutar en tu propia máquina. Este artículo explica qué hace falta de verdad, qué se gana, y en qué casos sigue siendo mejor la nube.

Qué significa "en local"

Que el modelo se descarga una vez y se ejecuta en tu procesador o en tu tarjeta gráfica. El audio no se sube a ninguna parte. No hay llamada a una API, no hay coste por minuto y no hace falta conexión.

En la práctica sirve para dos cosas distintas:

  • Transcribir: convertir en texto una reunión grabada, una entrevista o el audio de un vídeo.
  • Dictar: hablar y que el texto aparezca en la aplicación que estés usando, sustituyendo al teclado.

Qué ordenador hace falta, sin marketing

Esta es la pregunta que más se responde mal, así que va con números aproximados y honestos.

Whisper viene en varios tamaños, y el tamaño decide todo:

  • tiny y base (unos 75–150 MB): corren en casi cualquier portátil, solo con CPU. Van rápido y se equivocan bastante, sobre todo con nombres propios y acentos marcados. Valen para buscar algo dentro de un audio, no para publicar.
  • small (unos 500 MB): el equilibrio razonable. Con 8 GB de RAM funciona en CPU, sin ir sobrado.
  • medium (1,5 GB): ya se nota la calidad. En CPU es lento; con gráfica dedicada, cómodo.
  • large-v3 y sus variantes turbo (unos 3 GB): calidad de referencia. Aquí sí quieres una gráfica dedicada con 6 GB de VRAM o más.

Como regla práctica: sin gráfica dedicada, quédate en small. Con gráfica, large en su variante turbo. En un Mac con chip de Apple la cosa mejora bastante, porque el modelo puede usar la Neural Engine y va notablemente más rápido que en CPU pura.

Sobre velocidad: con gráfica decente, una hora de audio se transcribe en pocos minutos. Solo con CPU y modelo small, cuenta con algo parecido a la duración del propio audio. No es instantáneo, pero se lanza y se deja trabajando.

Las ventajas

Procesamiento local. Whisper puede transcribir el audio en el propio ordenador, sin enviarlo a un servicio de transcripción en la nube.

Coste cero por uso. Los servicios cobran por minuto. Si transcribes cuatro horas a la semana, eso es una factura mensual permanente. En local, la factura es la luz.

Sin límites ni cuotas. Puedes transcribir un archivo histórico entero de golpe. En un servicio de pago, eso mismo es una decisión de presupuesto.

Funciona sin conexión. En un avión, en un rodaje sin cobertura o con una wifi de hotel, sigue funcionando.

No caduca. El modelo está descargado. Si mañana cambian los precios o cierra el servicio, tu instalación sigue igual.

Las desventajas, en detalle

La calidad depende del modelo, y el modelo de tu máquina. Esta es la principal. Un tiny en un portátil viejo comete errores que un servicio de pago no comete. Comparar "local" con "nube" sin decir qué modelo se usa es hacer trampa.

La primera vez hay que descargar. Entre 500 MB y 3 GB según el modelo. Una sola vez, pero hay que hacerlo.

Consume la máquina mientras trabaja. Mientras transcribe, el ordenador va más lento y el ventilador se nota. En un portátil, la batería baja rápido.

La diarización es más floja. Separar quién dice qué —"esto lo dijo Ana, esto Luis"— es donde los servicios comerciales tienen más ventaja. En local existe, pero es peor.

El audio malo sigue siendo audio malo. Ni la nube ni lo local salvan una grabación con eco, con tres personas hablando a la vez o con el micrófono a dos metros. La calidad de entrada manda más que el modelo.

Idiomas y acentos desiguales. Whisper va muy bien en español e inglés. En idiomas con menos datos de entrenamiento, o con acentos muy marcados y mucha jerga técnica, la tasa de error sube.

Cuándo sigue ganando la nube

Con la misma honestidad:

  • Si tu ordenador es modesto y necesitas calidad alta, un servicio de pago te dará mejor resultado que un tiny local.
  • Si necesitas diarización fina con muchos interlocutores.
  • Si transcribes muy poco, tres audios al año, no compensa ni descargar el modelo.
  • Si necesitas resultado inmediato en volumen alto y tu máquina no da abasto.

Es una decisión de caso, no de bando.

Lo que hace útil una transcripción

Transcribir por transcribir sirve de poco: acabas con un .txt de nueve mil palabras que tampoco vas a leer.

Donde esto cambia es cuando la transcripción entra en un índice. Si lo que se dijo en cada vídeo es texto buscable, puedes preguntar "la entrevista donde habla del proceso a mano" y llegar al minuto exacto, meses después, sin recordar la fecha ni el nombre del archivo.

En Polimake Desktop la transcripción es gratuita y local, precisamente porque la ejecuta tu máquina. Lo que se paga —si lo quieres— es que ese texto y ese material vivan en un archivo compartido, buscable por todo el equipo y accesible desde tu asistente. Ahí sí hay almacenamiento detrás.

Pero la parte de transcribir en tu ordenador, sin que el audio salga de él, es gratis y lo seguirá siendo. No por generosidad: porque no nos cuesta nada.