Buscar vídeos por objetos: qué funciona de verdad y qué no
Qué rendimiento tiene de verdad el reconocimiento de objetos sobre material bruto, la diferencia entre etiquetas y descripciones, y por qué buscar por código de tiempo es otro problema.
“Sé que tengo un plano de un coche rojo pasando.” Esa frase es todo el problema de la búsqueda de vídeo, y hasta hace poco la única respuesta era abrir clips hasta dar con él.
La búsqueda por objetos cambia eso, pero no como sugieren las demostraciones. Esto es lo que hace de verdad, cuánta precisión tiene realmente, y cómo ponerla a funcionar sobre tus propios discos.
Por qué tu Mac no puede hacer esto ya
Spotlight es un buen índice. Conoce todos los nombres de archivo, todas las carpetas, el texto completo de tus documentos, los EXIF de tus fotos, la duración y las dimensiones de tus vídeos.
No sabe qué aspecto tiene un vídeo. Ningún sistema operativo indexa el contenido de imagen, porque hasta hace poco eso significaba decodificar cada fotograma de cada archivo y pasarlo por un modelo, algo ni remotamente asumible.
Así que la formulación honesta de “buscar vídeos por objetos” es un trabajo en dos pasos:
- Generar texto que describa lo que hay en cada clip
- Buscar ese texto con las herramientas que ya tienes
El paso dos está resuelto desde 2005. El paso uno es la parte nueva, y ahí está todo lo interesante.
Cómo funciona el paso de descripción
Un modelo de visión no ve tu clip. Muestrea fotogramas, normalmente entre ocho y treinta según la duración, y mira esos.
Ese muestreo tiene consecuencias que conviene entender:
- Lo que persiste se encuentra. Un coche aparcado diez segundos en cuadro aparecerá en algún fotograma muestreado.
- Lo que pasa fugazmente se pierde. Un pájaro que cruza el encuadre medio segundo probablemente cae entre muestras.
- La descripción refleja el clip entero, no un instante. Obtienes “una carretera costera con tráfico”, no un registro por segundo.
Para casi todo el material eso es exactamente lo correcto, porque buscas el clip, no el fotograma. Quieres pasar de 400 archivos a tres y después usar los ojos.
Lo que acierta
Después de unos miles de clips, las categorías fiables son constantes:
Personas y su disposición. Una persona, un grupo, una multitud. Sentados, de pie, caminando, hablando a cámara. Primer plano, plano abierto.
Vehículos y transporte. Coche, camión, bicicleta, barco, avión, tren. El color casi siempre, el modelo rara vez.
Lugares, por tipo. Cocina, oficina, calle, bosque, playa, montaña, estadio, nave. Es una de las categorías más sólidas y la más útil en la práctica.
Objetos comunes. Comida, portátiles, herramientas, instrumentos, muebles, señalización, animales al nivel de “perro” y “pájaro”.
Condiciones. Día o noche, interior o exterior, soleado o nublado, hora dorada. Para casar planos en un montaje valen tanto como los sujetos.
Cámara y encuadre. Estático o a mano, dron o suelo, primer plano o abierto, movimientos evidentes.
Combina dos o tres de esas y tienes una búsqueda real: “cocina, dos personas, luz de día” reduce 400 clips a cuatro.
Lo que falla
Igual de constante, y conviene saberlo antes de fiarte:
Identificación fina. “Pez” es fiable. “Pez globo” depende mucho del modelo. Un modelo en la nube suele acertar especies, razas y plantas. Un modelo local pequeño te da la categoría.
Lugares y personas con nombre. Un modelo puede reconocer un perfil urbano famoso. No conoce el edificio de tu cliente, y no sabe que la persona en cuadro es Marcus salvo que se lo hayas dicho al sistema. Peor: puede nombrar con total seguridad la ciudad equivocada, que sale más caro que callar.
Texto en imagen. Los modelos en la nube leen carteles y pizarras sorprendentemente bien. Los modelos locales pequeños a menudo no.
Todo lo pequeño, rápido o medio tapado. El atrezo de la esquina, el logo en la taza, la cosa que solo aparece en 0:42.
Contar. “Tres personas” suele salir como “varias personas”. No construyas una búsqueda que dependa de cifras exactas.
La postura práctica: usa las descripciones generadas como el filtro que te lleva de cientos de clips a un puñado, y usa los ojos para el último paso. Es un 95 por ciento menos de rebobinado, que es de lo que va todo esto.
¿Etiquetas o descripciones? Las dos, para búsquedas distintas
Dos formas de texto generado, que sirven a consultas distintas.
Las etiquetas son una lista corta y controlada: cocina, entrevista, dia, mano. Buenas para filtrar y agrupar, porque la misma palabra significa siempre lo mismo. Es lo que hace funcionar un sistema de etiquetas para B-roll.
Las descripciones son una frase: “dos personas en una encimera de cocina, una habla a cámara, luz de mañana por la ventana”. Buenas para búsqueda de texto completo, porque las encuentras con cualquiera de sus palabras, incluidas las que no se te habría ocurrido definir como etiqueta.
Usa las dos. Etiquetas en las etiquetas de Finder del archivo, descripción en el nombre y en un archivo de texto adjunto. Así una búsqueda amplia toca la descripción y un filtro preciso toca las etiquetas.
Dónde guardarlo para que la búsqueda funcione
Generar el texto solo sirve si aterriza donde miran tus herramientas de búsqueda. En un Mac:
- Nombre de archivo:
Cocina-Entrevista-Dos-Personas-Manana_16x9_4K_25FPS.mp4. Visible en todas partes, buscable en todas partes. - Etiquetas de Finder: el vocabulario controlado. Indexadas por Spotlight, filtrables desde cualquier diálogo de abrir.
- Archivo de texto adjunto: la descripción larga y la transcripción. Spotlight indexa el contenido.
Fíjate en lo que no está en la lista: un catálogo propietario. Si la descripción solo existe dentro de una aplicación, entonces “buscar en mi material” significa en realidad “abre esa aplicación primero”, y en un disco de archivo de hace dos años puede que esa aplicación ni siquiera esté instalada. El argumento largo está en dónde deben vivir los metadatos.
La cuestión del código de tiempo
La petición evidente que viene después: no “qué clip tiene el coche rojo” sino “en qué segundo aparece el coche rojo”.
Ese es un problema bastante más difícil. Implica indexar a nivel de fotograma o de segundo, lo que multiplica el coste del análisis por uno o dos órdenes de magnitud y produce un índice que ningún sistema de archivos puede meter en un nombre.
Dónde está la cosa hoy:
- Contenido hablado: resuelto. Las transcripciones llevan códigos de tiempo por palabra de serie, así que buscar una frase te da el momento exacto. Si tu material son entrevistas, ya tienes búsqueda a nivel de momento. Mira transcribir vídeo en un Mac.
- Contenido visual: parcialmente, y pagando. Existen sistemas que lo hacen, sobre todo en servidor y cobrados por hora de material.
Para casi todo el trabajo independiente, la búsqueda visual por clip más la búsqueda por momento en lo hablado cubren las preguntas reales. Encuentras el clip en segundos y luego rebobinas treinta segundos, en vez de cuatro horas.
Nube o equipo
Las dos funcionan. Fallan de forma distinta.
La nube da las respuestas finas: especies, monumentos, texto legible, objetos concretos. Los fotogramas salen de tu equipo y pagas por clip.
El equipo, con Apple Silicon, da las categorías: pez, costa, cocina, multitud. Nada sale del equipo, sin coste por clip, funciona sin conexión. Para material con confidencialidad no es una preferencia: es la única versión que pasa una revisión de contrato. La búsqueda de vídeo con IA local detalla qué esperar.
El valor por defecto útil: en el equipo para el grueso, en la nube para el material donde una descripción vaga o equivocada te costaría tiempo más adelante.
Cliptag hace el paso de descripción en macOS. Analiza vídeo, fotos y audio, escribe un nombre descriptivo, aplica etiquetas de sujeto como etiquetas de Finder y guarda las transcripciones como texto junto al clip, de modo que tu búsqueda ocurre en Spotlight y no en otra aplicación. Plan gratuito con 25 análisis en la nube al mes, y modo local gratis e ilimitado.