Cómo transcribir vídeo en un Mac, y qué hacer con la transcripción
Transcripciones precisas sin conexión, cómo elegir entre TXT, SRT y DOCX, y la segunda vida de una transcripción cuando dejas de verla como subtítulos.
Transcribir era caro o malo. Pagabas alrededor de un euro por minuto a una persona, o conseguías un resultado automático que costaba más corregir que teclear de cero.
Eso se acabó. En un Mac con Apple Silicon la voz a texto corre ahora en el propio equipo, sin conexión, sin coste por minuto, con códigos de tiempo por palabra, en decenas de idiomas, con una precisión que con audio limpio supera a una mecanógrafa rápida. Es la pieza más madura de toda la historia de la IA y el vídeo.
Lo que casi todo el mundo sigue pasando por alto es la segunda mitad: para qué sirve una transcripción cuando dejas de pensar en ella como subtítulos.
Qué corre en local, y cómo de bien
Detrás hay modelos de la familia Whisper: modelos abiertos de reconocimiento de voz que vienen en varios tamaños. En Apple Silicon corren en la GPU y el Neural Engine, por eso un portátil los mueve con soltura.
Expectativas prácticas:
- Audio limpio de entrevista, una persona, micro decente: precisión muy alta. Los errores se concentran en nombres propios y términos técnicos.
- Dos personas, algún solapamiento: bien, con las partes solapadas hechas un lío.
- Audio ruidoso de localización, viento, cafetería: empeora de forma notable, aunque suele seguir siendo mejor que nada.
- Acentos marcados o cambio de idioma a media frase: variable. Pruébalo con tu propio material antes de prometerle nada a un cliente.
- Velocidad: más rápido que tiempo real en hardware moderno, a menudo varias veces. Una entrevista de 40 minutos es un café, no una tarde.
El intercambio entre tamaños de modelo es el de siempre. Uno pequeño es rápido y algo más descuidado. Uno mayor es más lento y mejor con audio difícil. Para buscar suele bastar el pequeño, porque “¿alguien dijo facturación?” no necesita puntuación perfecta. Para una entrega a cliente, usa el mayor.
Una peculiaridad sistemática que conviene conocer: los modelos de voz están entrenados para producir texto limpio y legible, así que eliminan en silencio las muletillas. Tu “eh” a menudo no aparece en la transcripción aunque se oiga perfectamente. Para un documento legible eso ayuda, y es un problema si querías usar la transcripción para localizar dudas.
Elegir un formato de exportación
Saca más de uno. Son baratos y sirven para cosas distintas.
| Formato | Para qué |
|---|---|
.txt | Buscar. Spotlight lo indexa, así que tus palabras habladas se vuelven localizables desde el escritorio. |
.srt | Subtítulos, e importar texto con códigos de tiempo a un programa de montaje. |
.docx | Enviar a una persona. Revisión, comentarios, validación del cliente. |
.pdf | Entrega y archivo, cuando el diseño no debe moverse. |
El infravalorado es .txt. Guardado junto al clip, convierte tu contenido hablado en parte del mismo índice de Spotlight que todo lo demás en el Mac. Buscar una frase a medio recordar de una entrevista de hace dieciocho meses devuelve el archivo de transcripción, en la carpeta, al lado del vídeo. Eso es búsqueda a nivel de momento en tu archivo, al precio de guardar un archivo de texto. Más sobre ese patrón en encontrar clips sin abrir Premiere.
Nombrar y archivar transcripciones
La regla: una transcripción vive junto a su clip y comparte su nombre.
Entrevista-Azotea-Marcus_16x9_4K_25FPS.mp4
Entrevista-Azotea-Marcus_16x9_4K_25FPS.txt
Entrevista-Azotea-Marcus_16x9_4K_25FPS.srt
No en una carpeta Transcripciones tres niveles más allá, y no con un nombre que solo coincida por casualidad. Cuando una búsqueda toque el archivo de texto, quieres el vídeo a un golpe de vista, y cuando archives el proyecto, quieres que viajen juntos.
Si mantienes una carpeta de transcripciones aparte para entregas, que sea una copia. El conjunto de trabajo se queda junto al material.
Los usos más allá de los subtítulos
Aquí está el valor de verdad, y es la parte a la que casi ningún flujo llega.
Encontrar el momento. Las transcripciones con códigos de tiempo convierten “¿dónde habló de la cadena de suministro?” en una búsqueda de texto que devuelve un código de tiempo. En trabajo con muchas entrevistas es el mayor ahorro de tiempo disponible en toda la posproducción.
Nombrar clips. La primera frase de un clip hablado suele ser una excelente descripción de él. Un clip que empieza con “bueno, fundamos la empresa en 2019” es evidentemente el clip del origen, y puede llamarse así automáticamente.
Ver la estructura antes de montar. Con todas las entrevistas transcritas tienes el contenido entero del rodaje como texto en una pantalla. Leer 12.000 palabras son veinte minutos. Ver ese mismo material son cuatro horas. Ves la forma de la pieza, detectas la respuesta repetida, notas que la mejor frase llegó al final de una toma dispersa, y planificas la historia antes de abrir una línea de tiempo.
Pasarlo a otra cosa. Una transcripción es texto portátil, así que puede ir a lo que uses para pensar: un documento, un esquema, un resumen, una búsqueda sobre todo un archivo. La transcripción es la materia prima de la estructura, y la estructura es el trabajo de verdad de una pieza.
Reaprovechar. Versión en blog, notas del programa, marcas de capítulo, tarjetas de cita, subtítulos. Todo empieza con texto que ya tienes.
Accesibilidad y alcance. Los subtítulos no son opcionales en muchos canales, y las plataformas indexan su texto, lo que afecta a si alguien encuentra el vídeo siquiera.
Lo único que corriges a mano
Los nombres propios. Siempre.
Los nombres de personas, empresas, productos y lugares son donde se equivoca cualquier modelo de voz, en la nube o local. Es una pasada de dos minutos: buscar y reemplazar los cuatro nombres que se repiten, y la transcripción pasa de útil a publicable.
Si transcribes el mismo tema a menudo, mantén una lista corta de los términos que se destrozan y de cómo deben escribirse. Sigue siendo útil de proyecto en proyecto.
Dónde encaja en la ingesta
La transcripción va en la ingesta, no en el montaje. La razón es la misma que con el etiquetado: en la ingesta estás conociendo el material de todos modos, y después del montaje ya no vas a volver.
Un orden que funciona:
- Copia la tarjeta, verifica.
- Analiza: descripciones y etiquetas de sujeto para todo, transcripciones para todo lo que tenga voz.
- Renombra y archiva, usando ambas cosas.
- Lee las transcripciones. Planifica la pieza.
- Abre el programa de montaje sabiendo lo que tienes.
El paso cuatro parece un lujo y resulta ser el ahorro de tiempo. Montar va mucho más rápido cuando ya sabes qué hay en el material.
Grabaciones de audio, no solo vídeo
Si grabas audio por separado, un lavalier, un micro de sala, una entrevista en una grabadora de mano, se aplica lo mismo y el beneficio es mayor, porque un archivo de audio no tiene miniatura ninguna. ZOOM0007.WAV es todavía más opaco que C0087.MP4.
Transcribir y describir grabaciones convierte una carpeta de archivos numerados en una biblioteca. Organizar grabaciones de audio cubre ese caso, incluidos los efectos y el ambiente donde no hay voz que transcribir.
Cliptag transcribe en el equipo en macOS como parte de la pasada de ingesta: sueltas una carpeta y cada clip hablado y cada grabación vuelve con transcripción, exportable como TXT, DOCX, PDF o SRT con códigos de tiempo. La transcripción se guarda junto al clip para que Spotlight la indexe. Modo local en Apple Silicon gratis e ilimitado.