Busca de vídeo com IA local: o que corre no seu próprio Mac em 2026

O que o Apple Silicon consegue fazer ao seu material sem ligação, quanto pior é do que a nuvem, e quando essa troca é obviamente a certa.

7 min de leitura

Há dois anos, “análise do seu material com IA” significava carregá-lo. Isso estava bem para um vlog de viagens e era inviável para qualquer coisa com uma cláusula de confidencialidade, que é quase todo o trabalho pago.

Isso mudou, em silêncio e bastante depressa. Um modelo que descreve um clipe suficientemente bem para o voltar a encontrar cabe hoje num portátil. Isto é o que consegue de facto, o que custa em qualidade, e onde a nuvem continua a merecer o trabalho.

O que significa “local” aqui

Hoje correm no equipamento três tipos de modelo, e vale a pena separá-los porque rendem de forma muito diferente.

Voz para texto. De longe o mais maduro. Os modelos da família Whisper correm confortavelmente em Apple Silicon e produzem transcrições com uma qualidade realmente próxima da dos serviços na nuvem, em dezenas de línguas, com códigos de tempo ao nível da palavra. Se no seu trabalho há pessoas a falar, só isto muda o seu fluxo. Detalhe em transcrever vídeo num Mac.

Visão e linguagem. Modelos de dois a oito mil milhões de parâmetros que olham para fotogramas e os descrevem por palavras. É a capacidade mais nova e a que tem maior distância para a nuvem. Chega para encontrar um clipe, não chega para escrever a sua lista de planos.

Classificação. Modelos pequenos, rápidos e específicos: é um clipe falado ou um recurso?, está desfocado?, é material sensível? Há anos que são rápidos e fiáveis no equipamento.

Em Apple Silicon isto passa pelos próprios componentes da Apple e, cada vez mais, pelo MLX, uma estrutura de aprendizagem automática criada especificamente para a arquitetura de memória unificada. Essa arquitetura é a razão de um portátil conseguir fazê-lo: a GPU e a CPU partilham a mesma memória, portanto um modelo de vários gigabytes não tem de ser copiado por um barramento.

Que hardware é preciso mesmo

Números honestos, não de folheto.

EquipamentoO que esperar
Mac IntelOs modelos de visão locais são inviáveis. Use a nuvem.
M1 ou M2, 8 GBSó modelos pequenos, muita pressão de memória, lento. Possível, não agradável.
M1 a M4, 16 GBO ponto de entrada realista. Análise à volta de tempo real ou melhor, por clipe.
32 GB ou maisModelos maiores, melhores descrições, dá para continuar a trabalhar enquanto corre.
Série M Pro ou MaxBastante mais rápido, porque mais núcleos de GPU é mais débito.

Conte também com espaço em disco. Um modelo de visão são vários gigabytes, e um bom de voz mais um a três. Descarregá-los é um custo único, mas é real num portátil que está sempre a 90 por cento.

Desempenho na prática: conte com segundos para um clipe curto, e com um trabalho em segundo plano que lança e deixa correr para um cartão inteiro. Não é instantâneo. É sem supervisão, o que importa mais.

Quanto pior é realmente

Esta é a pergunta a que toda a gente quer uma resposta direta. A honesta:

Categorias: praticamente igual. Cozinha, rua, praia, floresta, escritório, multidão, entrevista, plano de drone. Um modelo local resolve tudo isso.

Detalhes: notoriamente pior. Onde um modelo na nuvem diz “peixe-balão sobre um recife de coral”, um local diz “peixe debaixo de água”. Onde o da nuvem lê a placa e lhe dá o nome da loja, o local diz “uma montra”.

Texto na imagem: muito pior. Ler quadros, sinalética e ecrãs é uma força dos modelos grandes e uma fraqueza dos pequenos.

Voz: quase igual. É a exceção. A transcrição no equipamento está suficientemente perto da da nuvem para que a diferença raramente importe com áudio limpo.

Consistência: o local costuma ser melhor. Um modelo pequeno dá-lhe sempre o mesmo vocabulário, o que para etiquetar é uma vantagem a sério. Um grande é mais eloquente e mais variável.

E agora o importante: para recuperar material, as descrições grosseiras costumam bastar. A sua busca não é “encontra o peixe-balão”. A sua busca é “qual destes 400 clipes é o de debaixo de água com o peixe”. “Peixe debaixo de água” responde a isso num segundo. Depois usa os olhos, que era o que ia fazer de qualquer maneira.

Os casos em que o grosseiro não chega são o registo para bibliotecas de stock, os arquivos que precisam de vocabulário controlado em profundidade, e qualquer fluxo em que alguém procurará mais tarde com palavras que não antecipou.

Quando o local é obviamente o certo

Não uma preferência, um requisito:

  • Contratos com cláusulas de confidencialidade. Quase todos os contratos de produção têm uma. Um carregamento pode violá-la mesmo que nada aconteça aos dados.
  • Material médico, jurídico e policial. Regulado, e à regulamentação não interessa o seu fluxo de trabalho.
  • Produtos por anunciar, material sob embargo, gravações internas. O risco de fuga é o trabalho de alguém.
  • Qualquer coisa com pessoas que não consentiram um tratamento. Transeuntes, menores, locais sensíveis.
  • Material pessoal que simplesmente não quer no servidor de outra pessoa.
  • Volume. Dez mil clipes a qualquer preço por clipe é dinheiro a sério. A análise no equipamento custa eletricidade.
  • Sem ligação. Montar num avião, num hotel com wifi hostil, em localização.

Essa lista cobre uma parte muito grande do trabalho profissional, e por isso a capacidade no equipamento deixou de ser um nicho.

O que a análise local continua a não conseguir

Por completude:

  • Não conhece as suas pessoas nem os seus locais. Nenhum modelo conhece, a não ser que lho diga.
  • Não consegue ler o seu projeto. Qual é a boa tomada não é uma propriedade visual.
  • Não indexa por código de tempo. Obtém uma descrição do clipe, não um registo do clipe. Essa distinção está em procurar vídeos por objetos.
  • Não toca no RAW de câmara. R3D, BRAW, ProRes RAW, ARRIRAW e DNG são contentores fechados para quase todas as ferramentas. Transcodifique antes.
  • Aquece o portátil. Analisar um cartão inteiro de forma sustentada é uma carga pesada de GPU. Num equipamento sem ventoinha, abranda.

Uma mistura sensata

A montagem a que chega quase todo o profissional que experimenta as duas vias:

  1. No equipamento por omissão, para o cartão inteiro, logo a seguir à ingestão. Grátis, privado, sem supervisão.
  2. Na nuvem de forma seletiva, para o material onde a precisão compensa: o B-roll com valor de stock, a filmagem que vai revender, o arquivo que procurará daqui a cinco anos com palavras que hoje não consegue prever.
  3. Transcrição sempre local, porque a diferença de qualidade é pequena e as transcrições são o resultado com mais valor por unidade de esforço.

Assim a questão da confidencialidade só surge com os clipes que decidiu enviar conscientemente, e nunca com o grosso da sua biblioteca.

Onde acontece a busca em si

Vale a pena dizê-lo claramente: o modelo não é o motor de busca. O modelo escreve texto. O seu sistema operativo procura texto.

Portanto a cadeia local termina onde termina toda a boa cadeia: descrições nos nomes, etiquetas de assunto como etiquetas do Finder, transcrições como ficheiros de texto junto aos clipes. O Spotlight indexa as três coisas. O resultado é que a sua “busca de vídeo com IA local” é simplesmente o Spotlight, sobre dados que finalmente existem.

Isso é uma vantagem, não um compromisso. Significa que a busca continua a funcionar quando o modelo estiver desinstalado, a app tiver desaparecido e o disco estiver ligado a um computador que nunca ouviu falar de nada disto. Como isso fica no dia a dia está em encontrar clipes sem abrir o Premiere.


Cliptag usa os dois modos no macOS. O modo local usa um modelo de visão através do MLX em Apple Silicon e é gratuito e ilimitado, com uma verificação no equipamento que impede que os clipes sensíveis cheguem sequer à nuvem mesmo com a análise na nuvem ativada. A análise na nuvem existe para o material onde a precisão compensa, com 25 análises por mês no plano gratuito.

Perguntas
A IA consegue analisar vídeo sem ligação à internet?

Num Mac com Apple Silicon, sim. Os modelos de visão de dois a oito mil milhões de parâmetros correm na GPU e no Neural Engine do próprio equipamento e produzem descrições de clipe utilizáveis. A voz para texto também corre localmente e está perto da qualidade da nuvem. Nada é carregado e não há custo por clipe.

De quanta RAM preciso para analisar vídeo localmente?

16 GB de memória unificada são um piso razoável para trabalhar com conforto, e mais memória significa poder usar um modelo maior e mais preciso. Os equipamentos de 8 GB funcionam com modelos pequenos mas passam muito tempo a trocar memória. Conte ainda com vários gigabytes de disco para o próprio modelo.

Um modelo local é tão bom como um na nuvem?

Não, e quem disser o contrário está a exagerar. Espere categorias mais amplas: peixe em vez de peixe-balão, vila costeira em vez de uma vila com nome. Para encontrar um clipe entre quatrocentos, a resposta mais ampla costuma bastar. Para registo detalhado, a nuvem é mensuravelmente melhor.

Porque é que a análise local importa no trabalho com clientes?

Porque muitos contratos de produção incluem cláusulas de confidencialidade que um carregamento tecnicamente viola, independentemente do que o serviço faça com os dados. Material médico, jurídico, de produto por anunciar e sob embargo entram todos nessa categoria. A análise no equipamento elimina a questão por completo.

Experimente no seu próprio material

Largue uma pasta. Receba nomes, etiquetas e transcrições.

A Cliptag lê o seu vídeo, fotos e áudio, dá a cada ficheiro um nome pelo que está lá dentro e arquiva-o onde o vai voltar a encontrar. Plano gratuito, sem conta, e o modo local continua gratuito e ilimitado.

Descarregar grátis para Mac Ou experimentar no navegador
macOS 11+ · Sem conta · Sem cartão
Continuar a ler
Procurar vídeos por objetos: o que funciona mesmo e o que não Que desempenho tem mesmo o reconhecimento de objetos em material bruto, a diferença entre etiquetas e descrições, e porque é que procurar por código de tempo é outro problema. Gestão de material de vídeo com IA: o que faz mesmo em 2026 O que a IA faz realmente a um clipe, onde devem viver os metadados, e como montar tudo sem prender a sua biblioteca a uma subscrição. Como transcrever vídeo num Mac, e o que fazer com a transcrição Transcrições precisas sem ligação, como escolher entre TXT, SRT e DOCX, e a segunda vida de uma transcrição quando deixa de a ver como legendas.