ComfyUI com MiniMax H3: melhor do que o Kling AI, o Seedance e outros geradores de vídeo na versão gratuita?

Os geradores de vídeo com IA são significativamente mais difíceis de usar gratuitamente do que os LLMs típicos, como o ChatGPT, já que a maioria dos provedores é mesquinha com créditos gratuitos. Fazer com que eles criem exatamente o que o senhor deseja — mantendo, ao mesmo tempo, uma aparência boa e consistente — é ainda mais difícil. Por isso, decidi testar a alternativa: hospedar um modelo local, como o MiniMax H3.
Meu filho quer usar IA para gerar seu próprio vídeo — bem, um vídeo de montagem de blocos — sobre sabres de luz. Atualmente, ele está fascinado pelo assunto. Mas, como eu não queria gastar imediatamente muito dinheiro com uma assinatura cara de um serviço de IA de vídeo para suas experiências, ele inicialmente tentou usar o Kling AI e serviços semelhantes gratuitamente.
A maioria dos geradores de vídeo com IA atrai você com um crédito inicial gratuito para que crie uma conta. Mas a armadilha logo fica evidente: se você quiser criar mais do que um ou dois vídeos de três segundos por dia de forma contínua, rapidamente é levado a adquirir uma assinatura cara.
Mesmo visualmente, porém, os vídeos criados até aquele momento não eram particularmente satisfatórios. Manter a consistência de ambientes, objetos e personagens também costuma ser difícil. O garoto, desapontado, me levou a experimentar uma solução local.
Modelos e soluções locais exigem, naturalmente, hardware potente. Estamos realizando o teste em um Razer Blade 16 (2025) com uma RTX 5090 e 24 GB de VRAM. Em geral, a geração de vídeos só se torna razoavelmente interessante quando se tem 8 GB de VRAM, e, neste caso, mais realmente significa mais.
Existem muitas interfaces disponíveis para o modelo — optamos pelo MiniMax H3. Ele pode ser executado no Ollama, por exemplo, bem como no Pinokio ou no Stability Matrix. Este último também inclui o ComfyUI, uma interface gráfica para fluxos de trabalho de IA que não se limita à geração de vídeos. No entanto, encontrei problemas com essa combinação, por isso optei por um ComfyUI independente (ComfyUI.org), que pode ser baixado como um aplicativo para Windows e outras plataformas.

Os Top 10
» Os Top 10 Portáteis Multimídia
» Os Top 10 Portáteis de Jogos
» Os Top 10 Portáteis Leves para Jogos
» Os Top 10 Portáteis Acessíveis de Escritório/Empresariais
» Os Top 10 Portáteis Premium de Escritório/Empresariais
» Os Top 10 dos Portáteis Workstation
» Os Top 10 Subportáteis
» Os Top 10 Ultrabooks
» Os Top 10 Conversíveis
» Os Top 10 Tablets
» Os Top 10 Smartphones
» A melhores Telas de Portáteis Analisadas Pela Notebookcheck
» Top 10 dos portáteis abaixo dos 500 Euros da Notebookcheck
» Top 10 dos Portáteis abaixo dos 300 Euros
O ComfyUI exige um certo tempo de adaptação para iniciantes, mas abre um amplo leque de possibilidades para a geração de vídeos. O usuário cria fluxos de trabalho a partir de nós individuais, essencialmente um kit de ferramentas modular composto por várias ferramentas/nós. Cada nó possui uma entrada e uma saída e pode ser conectado a outros nós.

Todas as ferramentas estão separadas em nós individuais. Por exemplo, há um nó para o prompt de texto, vários nós de imagem que podem servir como referências ou etapas intermediárias antes da geração do vídeo, bem como outras ferramentas. Em teoria, seria possível carregar um modelo de IA distinto em cada nó — um LLM para o prompt de texto, um modelo de geração de imagens para os nós de imagem e assim por diante. Os modelos de IA, naturalmente, ocupam muito espaço de armazenamento. No final, todos os nós alimentam o nó de geração de vídeo, que produz o resultado final.
Inicialmente, fizemos experimentos com predefinições de “texto para vídeo”, mas logo passamos a nos concentrar mais na abordagem “referência para vídeo”.

O que torna isso particularmente útil é que também permite a consistência de ambientes, objetos e pessoas. Em nosso primeiro vídeo, por exemplo, criamos um navio de guerra construído com tijolos voando pela tela. Na resolução de 480p, a geração levou cerca de 5,5 minutos, embora resoluções mais altas sejam possíveis com hardware adequado. Em uma das próximas cenas, no entanto, queríamos utilizar exatamente a mesma nave de guerra novamente. Assim, tiramos capturas de tela das vistas frontal e traseira da nave espacial, importamos as imagens, vinculamos-as como referências denominadas Ship_front e Ship_rear ao nó principal e instruímos a IA a utilizar exatamente essa nave em outra cena. Caso contrário, a IA teria gerado uma aparência nova.
Após um breve período de familiarização com o sistema e com a ajuda do “Professor YouTube”, montamos rapidamente um primeiro fluxo de trabalho para nossas cenas de vídeo e geramos vídeos com os quais ambos ficamos muito satisfeitos. Um LLM — o ChatGPT, neste caso — nos ajudou a adaptar as instruções de texto especificamente para o MiniMax H3, tornando-as precisas e detalhadas.
Meu fluxo de trabalho: No ChatGPT, descrevi o visual que tinha em mente, especifiquei que certos nomes de marcas não deveriam aparecer, embora o visual pudesse ainda ser inspirado nelas, expliquei que deveria ter um toque cinematográfico e especifiquei quais referências (como Ship_front) deveriam ser incluídas. Só então descrevi a cena. Colei o prompt personalizado pelo ChatGPT no nó de texto do ComfyUI, adicionei imagens de referência, se necessário, e pronto.

Você também pode solicitar ao ChatGPT que gere um prompt universal com base no estilo desejado e em outros parâmetros, o qual poderá ser salvo para uso posterior. Se você inserir esse prompt novamente em um LLM, ele já terá todas as informações necessárias e você poderá descrever imediatamente a cena seguinte.
De qualquer forma, meu filho e eu ficamos significativamente mais satisfeitos com os resultados do que com as versões gratuitas do Kling AI, Seedance e serviços semelhantes. As diversas opções disponíveis também incentivam a experimentação, e você finalmente fica livre de limitações de crédito incômodas, solicitações de assinatura, anúncios e preocupações com a segurança de dados. A resolução, porém, ainda é um problema. Full HD ou resoluções superiores nem sequer estão disponíveis como opção, provavelmente porque os requisitos de hardware seriam muito elevados. Modelos futuros provavelmente se tornarão mais eficientes nesse aspecto. Por enquanto, o senhor também pode ampliar seu fluxo de trabalho com upscalers.
Qualquer pessoa que possua o hardware necessário e tenha interesse na geração de filmes deve dar uma olhada no ComfyUI e em um bom modelo de IA local. O ComfyUI, em particular, permite fluxos de trabalho incrivelmente complexos e em camadas — caso você realmente precise deles. Para começar, porém, o essencial já está disponível e pode ser aprendido rapidamente.









