Como fazer um lyric video (passo a passo, com opção de IA)
Um lyric video é um vídeo musical em que a letra é o próprio visual — texto animado, sincronizado com a música, fazendo o trabalho que uma performance ou uma narrativa fariam (o estilo de animação por trás da maioria é a tipografia cinética; definição completa no nosso glossário). Este guia é o passo a passo para fazer um de verdade: como preparar a letra, como temporizar e estilizar o texto, e as duas rotas para construí-lo — animando à mão, ou descrevendo o vídeo a um gerador com IA. Testamos a rota de IA em primeira mão em agosto de 2026: dois lyric videos completos de 20 segundos gerados a partir de briefs escritos com letras originais nossas, por US$ 0,19 e US$ 0,49 no total — o segundo incluindo uma revisão, documentada abaixo.
O que faz um lyric video funcionar
Um lyric video vive ou morre por uma única coisa: o espectador conseguir ler cada palavra na velocidade que a música dita. Todo o resto é estilo. Os vídeos que funcionam compartilham alguns hábitos:
- Sincronia vence espetáculo — as palavras precisam cair quando são cantadas. Um vídeo simples em sincronia perfeita vence um lindo que deriva.
- Um ou dois tratamentos tipográficos — lyric video não é vitrine de fontes. Uma display para as palavras de ênfase e uma de trabalho para o resto.
- Legível num relance — cada linha fica na tela tempo suficiente para ser lida duas vezes. Se uma linha passa num flash, é como se não existisse.
- Uma paleta que combine com a música — duas ou três cores, tiradas do clima da faixa, consistentes da primeira à última linha.
- Ênfase se gasta, não se espalha — scale pops e mudanças de cor vão nas palavras do refrão. Se toda palavra salta, nenhuma salta.
Como fazer um lyric video, passo a passo
Passo 1: Resolva os direitos primeiro
Antes de qualquer design: confirme que você tem o direito de usar a música e a letra. Sua própria música ou letra original — sem problema. Uma faixa encomendada ou um instrumental licenciado — verifique se a licença cobre a exibição da letra. A música lançada de outra pessoa — você precisa de permissão dos detentores de direitos (normalmente a editora, no caso das letras), mesmo para um lyric video "de fã"; as plataformas os removem rotineiramente. Todos os passos seguintes assumem isso resolvido. Para nossos testes, escrevemos a letra nós mesmos e sintetizamos nosso próprio instrumental.
Passo 2: Escreva a letra como linhas temporizadas
Transcreva a seção que vai animar — verso, refrão ou música inteira — em linhas curtas, uma respiração cada, na ordem exata. Essa folha de linhas é o esqueleto do vídeo inteiro: a animação a segue linha a linha, então acerte pontuação, maiúsculas e grafias estilizadas agora, não depois de o texto estar animado. Um esclarecimento para a rota gerada: se a faixa tem vocal, a ferramenta transcreve o canto por conta própria — nesse caso, esta folha é sua lista de conferência para o Passo 7, não entrada obrigatória.
Passo 3: Marque as palavras de ênfase
Percorra a folha de linhas e marque as palavras que carregam a música — normalmente o gancho, a frase-título e um ou dois picos emocionais por seção. São essas palavras que merecem um scale pop, uma mudança de cor ou um tempo extra de tela. Três ou quatro palavras marcadas por refrão bastam.
Passo 4: Escolha a linguagem visual antes de animar
Decida três coisas de saída: o fundo (cor sólida, gradiente sutil ou textura lenta — footage agitado briga com o texto), a paleta (duas ou três cores do clima da faixa) e o vocabulário de movimento (revelação palavra a palavra para linhas conversacionais, scale pops para ganchos, deslizamentos para transições). Travar isso antes da produção é o que mantém coerente um vídeo de três minutos.
Passo 5: Construa — à mão ou por brief
A rota manual: um editor de timeline — After Effects, ou uma das alternativas gratuitas que testamos — onde você posiciona cada palavra na timeline contra a forma de onda e anima a entrada com keyframes. Reserve cerca de uma hora por 30 segundos de música quando já dominar a ferramenta, mais enquanto aprende. A rota gerada: descreva o vídeo a um agente de motion graphics com IA — o criador de lyric video do iArt — como daria o brief a um designer: cole as linhas temporizadas, nomeie o estilo, marque a ênfase — e se tiver a faixa, anexe antes de enviar (isso é o Passo 6). Nosso primeiro brief de teste, na íntegra:
"Create a 20-second kinetic typography lyric video for an indie-pop chorus. Lyrics, in this exact order: "City lights go quiet, but we're still awake" / "Every wrong turn tonight was a turn worth taking" / "Hold the moment steady, let the echoes fade" / "We were never lost — we were on our way". Each line gets roughly equal screen time, with words appearing in sync like a real lyric video. Style: bold kinetic typography on a deep navy background, warm amber and off-white text, subtle glow, late-night city mood; mix scale pops, word-by-word reveals, and one line sliding in; end holding the final line. Use only the lyrics I provided — do not change, add, or invent any words. No artist name, no watermark."
Repare na estrutura — são os Passos 2–4 por escrito: as linhas em ordem, as decisões de estilo, o plano de ênfase. A regra dura do final importa: sem ela, um gerador improvisa texto, e um lyric video com letra improvisada não vale nada.
Passo 6: Sincronize com a faixa real
Se você anima à mão, este é o trabalho de timeline: cada palavra posicionada contra a forma de onda. Na rota gerada, a ferramenta que testamos recebe a própria faixa como entrada — um passo de "adicionar áudio para sincronizar" antes de gerar. Ela escuta antes de animar: quando subimos nosso instrumental no modo de sincronia vocal, ela respondeu "No words found — is this instrumental? Use the Beat tab" — vocais são transcritos para sincronizar a letra a eles, e instrumentais vão para a sincronia por batida. Verificamos os dois lados. Voz: subimos uma locução falada das nossas quatro linhas; ela foi marcada como 16 segundos de inglês, e no vídeo final a entrada de cada linha na tela bateu com o instante em que é falada no arquivo — 0:00, 4,5 s, 9,3 s e 13,4 s. Uma música real de verdade passou no mesmo teste: um trecho coral de 25 segundos de uma canção inglesa para alaúde de 1597 (gravação Creative Commons) foi marcado como inglês e renderizado palavra por palavra no compasso do canto. Um achado honesto: a transcrição ouve mal uma palavra aqui e ali — "There" em vez de "The" nessa rodada; outra passada do mesmo arquivo ouviu mal uma frase curta diferente, então os erros variam de rodada para rodada — e a tela segue a transcrição mesmo quando o brief traz a linha correta. O conserto é uma mensagem de revisão de uma frase; a conferência do Passo 7 é como você pega isso. Também rodamos o teste inverso: um brief só de estilo, sem letra nenhuma — o vídeo pronto renderizou as palavras cantadas transcritas em sincronia, confirmando que na rota vocal a faixa sozinha basta como entrada. Batida: analisou nosso instrumental caseiro de 100 BPM exatamente como 100 BPM e temporizou as entradas das palavras à grade musical e aos transientes que detectou.

Os dois modos de sincronia como testamos: a aba Voice marcou nossa faixa como 16 segundos de inglês; a aba Beat detectou nosso instrumental exatamente a 100 BPM, com a biblioteca de faixas abaixo.
Passo 7: Confira cada palavra e exporte na especificação da plataforma
Leia o vídeo pronto contra a folha de linhas palavra por palavra — uma palavra errada entrega a letra errada para todo mundo, e com saída gerada essa checagem é inegociável. Depois exporte para o destino: 16:9 para YouTube, 9:16 para Shorts, Reels e TikTok, 1:1 para o feed quadrado. Na ferramenta testada, a proporção é um seletor definido antes de gerar, então decida o destino primeiro.
O que nossos dois testes produziram
Teste 1 — refrão em 16:9, sem áudio (US$ 0,19 no total). Com o brief acima, o agente deu a cada linha cinco segundos e um tratamento próprio: revelação palavra a palavra terminando num selo luminoso para "AWAKE", deslizamento de bordas opostas com "wrong turn" emoldurado em âmbar, trava emoldurada em "STEADY" com rastro fantasma sobre "echoes fade", e clímax de scale pop em "NEVER LOST —" segurando "on our way" até o fim. Depois lemos os 600 quadros contra a folha de linhas: quatro linhas, perfeitas letra a letra, nenhuma palavra inventada. Custo pela página de cobrança: US$ 0,10 de geração mais US$ 0,09 do render 1080p — US$ 0,19, uns dois minutos do brief ao arquivo.
O Teste 1 como exportado: cinco segundos por linha, a ênfase onde o brief marcou — US$ 0,19, sem revisões.
Teste 2 — vertical 9:16, sincronizado a uma faixa real (US$ 0,49 no total, uma revisão). O segundo teste combinou a rota de áudio e o formato vertical: nosso instrumental sintetizado enviado para sincronia por batida, proporção em 9:16 e um verso acústico mais lento. Primeiro a parte honesta: o primeiro render teve um defeito real — a primeira linha tocou perfeita e a tela ficou em branco a partir dos 11 segundos, com as linhas três e quatro nunca aparecendo. O conserto foi uma única mensagem descrevendo exatamente isso ("a linha 2 só mostra a palavra Coffee; as linhas 3 e 4 nunca aparecem"), que custou US$ 0,10 e uns dois minutos; o novo render trouxe as quatro linhas, palavra por palavra, com entradas alinhadas aos transientes que a análise de batida havia detectado. Total com as duas exportações: US$ 0,49. A lição para o fluxo é o Passo 7: confira cada quadro, e quando uma rodada falha, a revisão é uma frase, não uma reconstrução.
O mesmo quadro (14 s) antes e depois da revisão de uma frase: o primeiro render deixou a linha três em branco; o novo render mostra "Some days are made for staying" por inteiro.
O Teste 2 após a revisão, com som: o corte vertical sincronizado à batida — palavras caindo nos hits da faixa de 100 BPM enviada.
FAQ
Que software preciso para fazer um lyric video?
Duas opções. Uma ferramenta de animação com timeline — After Effects, ou uma alternativa gratuita como o Cavalry — onde você mesmo anima cada palavra contra a forma de onda; espere uma curva de aprendizado real e horas por música. Ou um gerador com IA como o iArt, onde você cola letra e estilo num brief escrito: nossos testes de 20 segundos custaram US$ 0,19 e US$ 0,49 em créditos em agosto de 2026, cada um em cerca de dois minutos do brief ao arquivo 1080p (o de US$ 0,49 inclui uma revisão de US$ 0,10; baixar o MP4 é um recurso Pro).
Posso fazer legalmente um lyric video de qualquer música?
Não — a gravação e a letra têm direitos autorais separados, e um lyric video usa os dois. Você está coberto com sua música original, obra encomendada ou faixas licenciadas para exibição de letra; para a música lançada de outra pessoa, precisa de permissão dos detentores de direitos. Na dúvida, pergunte à editora — as plataformas removem lyric videos sem licença rotineiramente.
Como a IA sincroniza o texto com a música?
A ferramenta testada recebe o arquivo de áudio como entrada antes de gerar e o escuta: faixas com palavras são transcritas para sincronizar a letra ao momento falado ou cantado, e instrumentais vão para análise de batida. Testamos os dois em agosto de 2026: uma locução das nossas quatro linhas produziu um vídeo em que cada linha aparece no segundo exato em que é falada (0:00, 4,5 s, 9,3 s, 13,4 s no nosso arquivo), e nosso instrumental caseiro foi identificado exatamente como 100 BPM — o tempo em que o sintetizamos.
Qual o tamanho ideal de um lyric video?
Depende da plataforma: 16:9 (1920×1080) para YouTube, 9:16 (1080×1920) para Shorts, Reels e TikTok, 1:1 para o feed quadrado. Se você gera em vez de animar à mão, defina a proporção antes de gerar — na ferramenta testada é um seletor com exatamente essas três opções, e nossos dois testes usaram 16:9 e 9:16.
Preciso digitar a letra?
Não, se a faixa tem vocal — as palavras vêm da transcrição. No nosso teste de agosto de 2026 enviamos uma música com um brief só de estilo, sem letra, e o vídeo pronto renderizou as palavras cantadas em sincronia. Letra digitada serve para a rota manual, instrumentais e briefs sem faixa — e ainda funciona como sua folha de conferência, porque o texto na tela segue a transcrição do áudio.
Como garantir que a letra gerada por IA fica exata?
Estabeleça a regra no brief — o nosso terminava com "use apenas a letra que forneci — não mude, adicione ou invente palavras" — e depois leia o vídeo pronto contra a folha de linhas palavra por palavra. Nos nossos testes com brief de texto, cada palavra renderizada bateu com o brief; os defeitos que encontramos foram uma lacuna de renderização (linhas ausentes, não erradas) e, no teste com música real, palavras mal ouvidas pela transcrição vocal ("There" por "The" — quais palavras varia entre passadas do mesmo arquivo) — cada um pego justamente por essa conferência e cada um consertado com uma única mensagem de acompanhamento.