Passar ao vertical é deitar fora dois terços da imagem
A sua fonte é 16:9. TikTok, Reels e Shorts são 9:16. Tudo o que separa esses dois formatos é uma decisão sobre o que se perde, e errar faz um clipe parecer estragado por melhor que seja o momento ou a legenda. É a parte de que quase ninguém fala, e é ela que decide se um clipe parece feito por uma pessoa ou por um script.
As duas respostas fáceis, e porque falham as duas
O corte centrado pega na faixa do meio e enche o ecrã. Eficaz num grande plano, desastroso num plano geral: a bola abre para a ala e o enquadramento simplesmente não a mostra, por isso está a ver uma reação a uma ação invisível.
O letterbox reduz a imagem toda e acrescenta barras. Nada se perde, mas fica tudo minúsculo, e um clipe inteiro assim parece o vídeo de um vídeo.
O erro de fundo é tratar o reenquadramento como uma decisão global. O enquadramento certo não é uma propriedade do vídeo. Muda de momento para momento, por isso a decisão tem de mudar com ele e depois manter-se firme dentro de cada plano, para que a imagem não trema nem derive.
O que escolhe, plano a plano
Os cortes de cena marcam as fronteiras, e cada troço é enquadrado segundo as suas próprias condições. O conteúdo falado acrescenta um segundo eixo: uma pessoa, duas ou uma mesa inteira pedem disposições diferentes, e escolher sem deixar alguém de fora nem esmagar todos numa faixa é a maior parte do trabalho.
Uma pessoa sustenta o momento. O enquadramento segue quem fala e mantém-se quieto em vez de derivar, porque uma imagem que respira lê-se como um erro mesmo quando está bem centrada.
Um plano geral cortado ao centro é a falha clássica: num clipe de futebol a bola abre para a ala e vê uma reação a uma ação invisível. Aqui a imagem mantém-se larga o suficiente para conservar a ação, posicionada sobre o sujeito real e não sobre o centro geométrico.
Duas pessoas em diálogo. A imagem divide-se e coloca um grande plano em cada uma, que é o que uma troca pede. Volta a um único enquadramento assim que uma delas sustenta o segmento sozinha.
Três ou quatro participantes, cada um na sua célula. Uma entrevista a quatro em grelha lê-se num telemóvel como um plano de conferência cortado nunca conseguirá.
Gameplay, gravações de ecrã e diretos em que uma câmara pequena ocupa um canto. O conteúdo fica com a parte de cima e a câmara ganha a sua própria faixa, em vez de um corte que escolhe um e perde o outro.
Cartões de título, gráficos em ecrã inteiro e diapositivos. Algumas coisas só fazem sentido inteiras, por isso são mostradas inteiras em vez de cortadas até perderem o sentido.
E você tem a última palavra
Um enquadramento automático que não se pode corrigir é pior do que não automatizar nada, porque o único plano que falha é aquele que o impede de publicar. O editor permite fixar o enquadramento de uma cena isolada sem mexer no resto do clipe, e arrastar a janela de corte à mão. Essas decisões por cena chegam intactas à exportação, o que parece óbvio e é justamente o que a maioria das pré-visualizações não garante.
A parte honesta
Nada disto é um modelo genial. É visão computacional e áudio a alimentar decisões que afinamos contra material real, vezes sem conta, olhando onde fica mal e corrigindo. A maior parte do progresso vem dos vídeos que o quebram: um jogo de futebol rápido, um podcast com vários anfitriões, uma gravação de ecrã sem um único rosto.
O desporto rápido é onde o trabalho continua, e vale a pena ser preciso sobre o que já funciona. Um plano geral de um jogo é exatamente onde o corte centrado falha com mais dureza: o lance abre para a ala e o enquadramento já deitou fora essa parte do campo. Aqui a imagem mantém-se larga o suficiente para conservar a ação e assenta sobre a própria ação em vez do meio da imagem. O que ainda não faz é seguir o lance dentro de um mesmo plano contínuo, como faria um operador de câmara. A qualidade do reenquadramento não é uma funcionalidade que se termina. Para uma ferramenta de clipping é o jogo todo, por isso o trabalho continua. Se quer saber onde está hoje, passe-lhe um vídeo e veja como enquadra cada momento.
Perguntas
Porque funciona em grandes planos e falha em todo o resto. Cortar ao centro um plano geral remove precisamente a parte da imagem para a qual esse plano existia. É o motivo mais comum para um vídeo cortado automaticamente parecer estragado mesmo quando o momento escolhido estava certo.
Nada se perde, mas fica tudo minúsculo. Um clipe inteiro em barras parece o vídeo de um vídeo. O letterbox é a resposta certa para um cartão de título e a errada para uma conversa, o que mostra porque a decisão não pode ser tomada de uma só vez para todo o clipe.
Sim, cena a cena. O editor permite fixar o enquadramento de um plano sem tocar nos outros, e essas decisões sobrevivem até à exportação em vez de serem uma ilusão da pré-visualização.
Esse é o caso que quebra os detetores ingénuos, por isso é tratado explicitamente: uma gravação de ecrã ou um troço de imagens de apoio sem pessoas é enquadrado pelo seu conteúdo e não por um rosto que não está lá.
Mantém o lance no enquadramento, coisa que um corte centrado não consegue: num plano geral remove precisamente a parte do campo para onde a ação acabou de se deslocar. O que ainda não faz é seguir o lance dentro de um plano contínuo como faria um operador, por isso uma jogada longa sem cortes é enquadrada e não seguida. É a parte em que continuamos a trabalhar, e preferimos dizê-lo a deixá-lo descobrir num jogo.
Não. É deteção de rostos e de pessoas, deteção de cortes, diarização de oradores e áudio, a alimentar regras afinadas com material que as põe à prova. A maior parte do progresso vem das falhas, não dos acertos.
Veja-o enquadrar as suas imagens
O teste interessante não é um plano de busto. Dê-lhe algo com um plano geral, um cartão de título e mais do que uma pessoa, e veja para onde vai a imagem.