Notebookcheck Logo

ComfyUI com MiniMax H3: melhor do que o Kling AI, o Seedance e outros geradores de vídeo na versão gratuita?

ⓘ AI-generated, MiniMax H3
Os geradores de vídeo com IA são significativamente mais difíceis de usar gratuitamente do que os LLMs típicos, como o ChatGPT, já que a maioria dos provedores é mesquinha com créditos gratuitos. Fazer com que eles criem exatamente o que o senhor deseja — mantendo, ao mesmo tempo, uma aparência boa e consistente — é ainda mais difícil. Por isso, decidi testar a alternativa: hospedar um modelo local, como o MiniMax H3.

Os geradores de vídeo com IA são significativamente mais difíceis de usar gratuitamente do que os LLMs típicos, como o ChatGPT, já que a maioria dos provedores é mesquinha com créditos gratuitos. Fazer com que eles criem exatamente o que o senhor deseja — mantendo, ao mesmo tempo, uma aparência boa e consistente — é ainda mais difícil. Por isso, decidi testar a alternativa: hospedar um modelo local, como o MiniMax H3.

Meu filho quer usar IA para gerar seu próprio vídeo — bem, um vídeo de montagem de blocos — sobre sabres de luz. Atualmente, ele está fascinado pelo assunto. Mas, como eu não queria gastar imediatamente muito dinheiro com uma assinatura cara de um serviço de IA de vídeo para suas experiências, ele inicialmente tentou usar o Kling AI e serviços semelhantes gratuitamente.

A maioria dos geradores de vídeo com IA atrai você com um crédito inicial gratuito para que crie uma conta. Mas a armadilha logo fica evidente: se você quiser criar mais do que um ou dois vídeos de três segundos por dia de forma contínua, rapidamente é levado a adquirir uma assinatura cara.

Mesmo visualmente, porém, os vídeos criados até aquele momento não eram particularmente satisfatórios. Manter a consistência de ambientes, objetos e personagens também costuma ser difícil. O garoto, desapontado, me levou a experimentar uma solução local.

Modelos e soluções locais exigem, naturalmente, hardware potente. Estamos realizando o teste em um Razer Blade 16 (2025) com uma RTX 5090 e 24 GB de VRAM. Em geral, a geração de vídeos só se torna razoavelmente interessante quando se tem 8 GB de VRAM, e, neste caso, mais realmente significa mais.

Existem muitas interfaces disponíveis para o modelo — optamos pelo MiniMax H3. Ele pode ser executado no Ollama, por exemplo, bem como no Pinokio ou no Stability Matrix. Este último também inclui o ComfyUI, uma interface gráfica para fluxos de trabalho de IA que não se limita à geração de vídeos. No entanto, encontrei problemas com essa combinação, por isso optei por um ComfyUI independente (ComfyUI.org), que pode ser baixado como um aplicativo para Windows e outras plataformas.

Comfy Desktop
ⓘ Screenshot
Comfy Desktop

O ComfyUI exige um certo tempo de adaptação para iniciantes, mas abre um amplo leque de possibilidades para a geração de vídeos. O usuário cria fluxos de trabalho a partir de nós individuais, essencialmente um kit de ferramentas modular composto por várias ferramentas/nós. Cada nó possui uma entrada e uma saída e pode ser conectado a outros nós.

Cada nó representa uma ferramenta ou uma etapa do processo e possui uma entrada e uma saída
ⓘ AI-generated, ChatGPT
Cada nó representa uma ferramenta ou uma etapa do processo e possui uma entrada e uma saída

Todas as ferramentas estão separadas em nós individuais. Por exemplo, há um nó para o prompt de texto, vários nós de imagem que podem servir como referências ou etapas intermediárias antes da geração do vídeo, bem como outras ferramentas. Em teoria, seria possível carregar um modelo de IA distinto em cada nó — um LLM para o prompt de texto, um modelo de geração de imagens para os nós de imagem e assim por diante. Os modelos de IA, naturalmente, ocupam muito espaço de armazenamento. No final, todos os nós alimentam o nó de geração de vídeo, que produz o resultado final.

Inicialmente, fizemos experimentos com predefinições de “texto para vídeo”, mas logo passamos a nos concentrar mais na abordagem “referência para vídeo”.

O caso mais simples, de texto para vídeo: um nó para selecionar a resolução, seguido pelo nó principal com a IA de vídeo e, por fim, a saída de vídeo, incluindo o formato
ⓘ Screenshot Comfy Desktop Screenshot
O caso mais simples, de texto para vídeo: um nó para selecionar a resolução, seguido pelo nó principal com a IA de vídeo e, por fim, a saída de vídeo, incluindo o formato

O que torna isso particularmente útil é que também permite a consistência de ambientes, objetos e pessoas. Em nosso primeiro vídeo, por exemplo, criamos um navio de guerra construído com tijolos voando pela tela. Na resolução de 480p, a geração levou cerca de 5,5 minutos, embora resoluções mais altas sejam possíveis com hardware adequado. Em uma das próximas cenas, no entanto, queríamos utilizar exatamente a mesma nave de guerra novamente. Assim, tiramos capturas de tela das vistas frontal e traseira da nave espacial, importamos as imagens, vinculamos-as como referências denominadas Ship_front e Ship_rear ao nó principal e instruímos a IA a utilizar exatamente essa nave em outra cena. Caso contrário, a IA teria gerado uma aparência nova.

Nossa imagem de referência SHIP-001 do navio construído com peças de LEGO, captura de tela de nosso primeiro vídeo
Nossa imagem de referência SHIP-001 do navio construído com peças de LEGO, captura de tela de nosso primeiro vídeo
Como precaução, inclua também uma imagem de referência SHIP-001_rear da vista traseira
Como precaução, inclua também uma imagem de referência SHIP-001_rear da vista traseira
Nosso vilão
Nosso vilão
A ponte do navio
A ponte do navio

Após um breve período de familiarização com o sistema e com a ajuda do “Professor YouTube”, montamos rapidamente um primeiro fluxo de trabalho para nossas cenas de vídeo e geramos vídeos com os quais ambos ficamos muito satisfeitos. Um LLM — o ChatGPT, neste caso — nos ajudou a adaptar as instruções de texto especificamente para o MiniMax H3, tornando-as precisas e detalhadas.

Meu fluxo de trabalho: No ChatGPT, descrevi o visual que tinha em mente, especifiquei que certos nomes de marcas não deveriam aparecer, embora o visual pudesse ainda ser inspirado nelas, expliquei que deveria ter um toque cinematográfico e especifiquei quais referências (como Ship_front) deveriam ser incluídas. Só então descrevi a cena. Colei o prompt personalizado pelo ChatGPT no nó de texto do ComfyUI, adicionei imagens de referência, se necessário, e pronto.

O ChatGPT criou esta solicitação com base em nossas informações
ⓘ Screenshot ChatGPT
O ChatGPT criou esta solicitação com base em nossas informações

Você também pode solicitar ao ChatGPT que gere um prompt universal com base no estilo desejado e em outros parâmetros, o qual poderá ser salvo para uso posterior. Se você inserir esse prompt novamente em um LLM, ele já terá todas as informações necessárias e você poderá descrever imediatamente a cena seguinte.

De qualquer forma, meu filho e eu ficamos significativamente mais satisfeitos com os resultados do que com as versões gratuitas do Kling AI, Seedance e serviços semelhantes. As diversas opções disponíveis também incentivam a experimentação, e você finalmente fica livre de limitações de crédito incômodas, solicitações de assinatura, anúncios e preocupações com a segurança de dados. A resolução, porém, ainda é um problema. Full HD ou resoluções superiores nem sequer estão disponíveis como opção, provavelmente porque os requisitos de hardware seriam muito elevados. Modelos futuros provavelmente se tornarão mais eficientes nesse aspecto. Por enquanto, o senhor também pode ampliar seu fluxo de trabalho com upscalers.

Qualquer pessoa que possua o hardware necessário e tenha interesse na geração de filmes deve dar uma olhada no ComfyUI e em um bom modelo de IA local. O ComfyUI, em particular, permite fluxos de trabalho incrivelmente complexos e em camadas — caso você realmente precise deles. Para começar, porém, o essencial já está disponível e pode ser aprendido rapidamente.

Google LogoAdd as a preferred source on Google
Mail Logo
> Análises e revisões de portáteis e celulares > Notícias > Arquivo de notícias 2026 08 > ComfyUI com MiniMax H3: melhor do que o Kling AI, o Seedance e outros geradores de vídeo na versão gratuita?
Christian Hintze, 2026-08-26 (Update: 2026-08-26)