Recherche vidéo par IA locale : ce qui tourne sur votre Mac en 2026

Ce qu'Apple Silicon sait faire de vos rushes hors ligne, à quel point c'est moins bon que le cloud, et quand ce compromis est évidemment le bon.

7 min de lecture

Il y a deux ans, « analyse de vos rushes par IA » voulait dire les envoyer. C’était bien pour un vlog de voyage et rédhibitoire pour tout ce qui portait une clause de confidentialité, c’est-à-dire l’essentiel du travail rémunéré.

Cela a changé, discrètement et assez vite. Un modèle qui décrit un plan assez bien pour le retrouver tient aujourd’hui sur un portable. Voici ce que cela vous apporte vraiment, ce que cela coûte en qualité, et où le cloud mérite encore le travail.

Ce que « local » veut dire ici

Trois types de modèles tournent aujourd’hui en local, et il vaut la peine de les distinguer parce qu’ils se comportent très différemment.

La reconnaissance vocale. De loin la plus mûre. Les modèles de la famille Whisper tournent confortablement sur Apple Silicon et produisent des transcriptions d’une qualité réellement proche des services cloud, dans des dizaines de langues, avec des timecodes au mot. Si des gens parlent dans votre travail, cela seul change votre flux. Détail dans transcrire une vidéo sur Mac.

Vision et langage. Des modèles de deux à huit milliards de paramètres qui regardent des images et les décrivent en mots. C’est la capacité la plus récente et celle qui a le plus grand écart avec le cloud. Suffisant pour retrouver un plan, pas pour écrire votre liste de plans.

La classification. Des modèles petits, rapides et spécialisés : est-ce un plan parlé ou un plan de coupe, est-ce flou, est-ce du matériel sensible. Ils sont rapides et fiables en local depuis des années.

Sur Apple Silicon cela passe par les briques d’Apple et, de plus en plus, par MLX, un cadre d’apprentissage automatique conçu spécifiquement pour l’architecture à mémoire unifiée. Cette architecture est la raison pour laquelle un portable y arrive : le GPU et le processeur partagent la même mémoire, donc un modèle de plusieurs gigaoctets n’a pas à être copié via un bus.

Quel matériel il faut vraiment

Des chiffres honnêtes, pas des chiffres de brochure.

MachineÀ quoi s’attendre
Mac IntelLes modèles de vision locaux sont impraticables. Utilisez le cloud.
M1 ou M2, 8 GoPetits modèles seulement, forte pression mémoire, lent. Possible, pas agréable.
M1 à M4, 16 GoLe vrai point d’entrée. Analyse autour du temps réel ou mieux, par plan.
32 Go et plusModèles plus grands, meilleures descriptions, on peut travailler pendant.
Série M Pro ou MaxNettement plus rapide, puisque plus de cœurs GPU signifie plus de débit.

Prévoyez aussi de l’espace disque. Un modèle de vision, c’est plusieurs gigaoctets, et un bon modèle de parole encore un à trois. Les télécharger est un coût unique, mais bien réel sur un portable toujours plein à 90 pour cent.

Débit en pratique : comptez quelques secondes pour un plan court, et une tâche de fond que vous lancez et laissez tourner pour une carte entière. Ce n’est pas instantané. C’est sans surveillance, ce qui compte davantage.

À quel point est-ce moins bon, vraiment

C’est la question à laquelle tout le monde veut une réponse franche. La voici :

Catégories : pratiquement pareil. Cuisine, rue, plage, forêt, bureau, foule, interview, plan de drone. Un modèle local gère tout cela.

Détails : nettement moins bon. Là où un modèle cloud dit « poisson-globe au-dessus d’un récif corallien », un modèle local dit « poisson sous l’eau ». Là où le cloud lit l’enseigne et vous donne le nom de la boutique, le local dit « une devanture ».

Texte à l’image : bien moins bon. Lire des tableaux, de la signalétique et des écrans est une force des grands modèles et une faiblesse des petits.

Parole : presque pareil. C’est l’exception. La transcription locale est assez proche de celle du cloud pour que la différence compte rarement avec un son propre.

Constance : le local est souvent meilleur. Un petit modèle vous donne toujours le même vocabulaire, ce qui pour du tagging est un vrai avantage. Un grand modèle est plus éloquent et plus variable.

Et maintenant l’essentiel : pour retrouver des rushes, des descriptions grossières suffisent généralement. Votre recherche n’est pas « trouve le poisson-globe ». Votre recherche est « lequel de ces 400 plans est celui sous l’eau avec le poisson ». « Poisson sous l’eau » y répond en une seconde. Ensuite vous utilisez vos yeux, ce que vous alliez faire de toute façon.

Les cas où le grossier ne suffit pas sont le dérushage pour banques d’images, les archives qui exigent du vocabulaire contrôlé en profondeur, et tout flux où quelqu’un cherchera plus tard avec des mots que vous n’avez pas anticipés.

Quand le local est évidemment le bon choix

Pas une préférence, une exigence :

  • Contrats avec clauses de confidentialité. Presque tous les contrats de production en ont une. Un envoi peut la violer même si rien n’arrive aux données.
  • Matériel médical, juridique et policier. Réglementé, et la réglementation se moque de votre flux de travail.
  • Produits non annoncés, contenus sous embargo, images internes. Le risque de fuite est le métier de quelqu’un.
  • Tout ce qui implique des personnes n’ayant pas consenti à un traitement. Passants, mineurs, lieux sensibles.
  • Matériel personnel que vous ne voulez tout simplement pas sur le serveur d’un autre.
  • Le volume. Dix mille plans à n’importe quel prix par plan, c’est de l’argent réel. L’analyse locale coûte de l’électricité.
  • Pas de connexion. Monter en avion, à l’hôtel avec un wifi hostile, en repérage.

Cette liste couvre une très grande part du travail professionnel, et c’est pourquoi la capacité locale a cessé d’être une niche.

Ce que l’analyse locale ne sait toujours pas faire

Pour être complet :

  • Elle ne connaît ni vos gens ni vos lieux. Aucun modèle ne les connaît, sauf si vous le lui dites.
  • Elle ne peut pas lire votre projet. Quelle est la bonne prise n’est pas une propriété visuelle.
  • Elle n’indexe pas au timecode. Vous obtenez une description du plan, pas un relevé du plan. Cette distinction est dans rechercher des vidéos par objets.
  • Elle ne touche pas au RAW caméra. R3D, BRAW, ProRes RAW, ARRIRAW et DNG sont des conteneurs fermés pour la plupart des outils. Transcodez avant.
  • Elle chauffe votre portable. Analyser une carte entière en continu est une charge GPU lourde. Sur une machine sans ventilateur, ça bride.

Un mélange sensé

Le montage auquel arrivent la plupart des professionnels après avoir essayé les deux voies :

  1. En local par défaut, pour toute la carte, juste après l’ingest. Gratuit, privé, sans surveillance.
  2. Dans le cloud de façon sélective, pour les rushes où la précision est rentable : le B-roll de qualité banque d’images, le tournage que vous revendrez, l’archive que vous chercherez dans cinq ans avec des mots imprévisibles aujourd’hui.
  3. Transcription toujours en local, parce que l’écart de qualité est faible et que les transcriptions sont le résultat au meilleur rapport valeur/effort.

Ainsi la question de la confidentialité ne se pose que pour les plans que vous avez sciemment envoyés, et jamais pour le gros de votre bibliothèque.

Où se passe la recherche elle-même

Il vaut la peine de le dire clairement : le modèle n’est pas le moteur de recherche. Le modèle écrit du texte. Votre système d’exploitation cherche du texte.

La chaîne locale se termine donc là où se termine toute bonne chaîne : descriptions dans les noms, mots-clés de sujet en tags Finder, transcriptions en fichiers texte à côté des plans. Spotlight indexe les trois. Le résultat, c’est que votre « recherche vidéo par IA locale » n’est rien d’autre que Spotlight, sur des données qui existent enfin.

C’est un avantage, pas un compromis. Cela veut dire que la recherche continue de fonctionner quand le modèle est désinstallé, l’application disparue et le disque branché sur une machine qui n’a jamais entendu parler de tout cela. À quoi cela ressemble au quotidien est dans retrouver des plans sans ouvrir Premiere.


Cliptag utilise les deux modes sur macOS. Le mode local s’appuie sur un modèle de vision via MLX sur Apple Silicon et il est gratuit et illimité, avec une vérification locale qui empêche les plans sensibles d’atteindre le cloud même quand l’analyse cloud est activée. L’analyse cloud est là pour les rushes où la précision est rentable, avec 25 analyses par mois dans l’offre gratuite.

Questions
L'IA peut-elle analyser de la vidéo sans connexion internet ?

Sur un Mac Apple Silicon, oui. Les modèles de vision de deux à huit milliards de paramètres tournent sur le GPU et le Neural Engine de la machine et produisent des descriptions de plan exploitables. La reconnaissance vocale tourne aussi en local et frôle la qualité du cloud. Rien n'est envoyé et il n'y a pas de coût par plan.

Combien de RAM faut-il pour analyser de la vidéo en local ?

16 Go de mémoire unifiée sont un plancher raisonnable pour travailler confortablement, et plus de mémoire signifie pouvoir faire tourner un modèle plus grand et plus précis. Les machines à 8 Go fonctionnent avec de petits modèles mais passent beaucoup de temps à échanger de la mémoire. Prévoyez aussi plusieurs gigaoctets de disque pour le modèle lui-même.

Un modèle local est-il aussi bon qu'un modèle cloud ?

Non, et quiconque prétend le contraire exagère. Attendez-vous à des catégories plus larges : poisson au lieu de poisson-globe, village côtier au lieu d'un village nommé. Pour retrouver un plan parmi quatre cents, la réponse plus large suffit généralement. Pour du dérushage détaillé, le cloud est mesurablement meilleur.

Pourquoi l'analyse locale compte-t-elle pour le travail client ?

Parce que beaucoup de contrats de production comportent des clauses de confidentialité qu'un envoi viole techniquement, quoi que le service fasse des données. Le matériel médical, juridique, les produits non annoncés et les contenus sous embargo entrent tous dans cette catégorie. L'analyse locale supprime la question entièrement.

Essayez sur vos propres rushes

Déposez un dossier. Récupérez noms, tags et transcriptions.

Cliptag lit vos vidéos, vos photos et votre son, nomme chaque fichier selon ce qu'il contient vraiment et le classe là où vous le retrouverez. Offre gratuite, sans compte, et le mode local reste gratuit et illimité.

Télécharger gratuitement pour Mac Ou essayer dans le navigateur
macOS 11+ · Sans compte · Sans carte
À lire ensuite
Rechercher des vidéos par objets : ce qui marche vraiment et ce qui ne marche pas Quelle performance a réellement la reconnaissance d'objets sur des rushes, la différence entre tags et descriptions, et pourquoi la recherche au timecode est un autre problème. Gestion des rushes par IA : ce qu'elle fait vraiment en 2026 Ce que l'IA fait réellement à un plan, où les métadonnées doivent vivre, et comment mettre tout ça en place sans lier votre bibliothèque à un abonnement. Comment transcrire une vidéo sur Mac, et quoi faire de la transcription Obtenir des transcriptions précises hors ligne, choisir entre TXT, SRT et DOCX, et la seconde vie d'une transcription quand on cesse d'y voir des sous-titres.