O Meta Muse Glimmer funciona offline em uma GPU, mas requer 24 GB de VRAM

A Meta lançou o Muse Glimmer em 10 de agosto, um modelo de linguagem com cerca de 30 bilhões de parâmetros. O que se destaca não é tanto o modelo em si, mas sim a licença e a máquina-alvo. Os pesos estão disponíveis no Hugging Face sob a licença Apache 2.0, de modo que você pode baixá-los, modificá-los e utilizá-los comercialmente. E ele não foi desenvolvido para rodar em um data center, mas em uma única placa de vídeo sob sua mesa.
O modelo é de autoria do Meta Superintelligence Lab e foi derivado do Muse Spark, um modelo maior, o que significa que um modelo grande ensinou um modelo menor a responder. Ele aceita texto e imagens como entrada, mas produz apenas texto, suporta mais de 100 idiomas e opera com uma janela de contexto de mais de 131.000 tokens. Seu conhecimento se limita até 4 de janeiro de 2026. Os lançamentos mais recentes da Meta foram o agente Muse Code e o gerador Muse Image.
24 GB de VRAM são o requisito mínimo
Na precisão máxima, o modelo precisaria de 64 GB de memória de vídeo. A Meta o comprime para aproximadamente 4 bits por meio da quantização, uma forma mais grosseira de armazenar números que ocupa muito menos espaço. Isso reduz a parte de linguagem para menos de 20 GB, o que deixa espaço para o codificador de visão e o cache para a conversa em andamento.
Duas variantes prontas para uso são fornecidas com o modelo. O K-Quant-Dynamic tem como meta 32 GB e perde 0,2% de precisão, em média, em 15 benchmarks, enquanto o K-Quant-17GB cabe em 24 GB e perde 1,0%. Na prática, isso significa uma GeForce RTX 5090, RTX 4090, RTX 3090 ou um Mac com um M4 Max. Uma placa de gama média com 12 GB está fora de questão. Caso disponha de menos memória, nosso guia aborda modelos menores para o seu próprio laptop, e até mesmo o iPhone agora executa um modelo de linguagem utilizável.
Um acelerador torna o processo três vezes mais rápido
Para evitar que um modelo local pareça lento, a Meta fornece um auxiliar chamado DFlash. Ele propõe 16 tokens de uma só vez, e o modelo grande verifica todo o bloco em uma única passagem, corrigindo apenas o que está errado. De acordo com as próprias medições da Meta, a taxa de transferência em uma RTX 5090 sobe de 74,9 para 233,4 tokens por segundo, um fator de 3,1. Um MacBook com um M5 Max passa de 26,6 para 50,2 tokens, e o M4 Max, de 23,7 para 37,8.
A AMD divulgou seus próprios números no mesmo dia. Um mini-PC com um Ryzen AI Max+ 395 atinge até 24 tokens por segundo e uma Radeon AI PRO R9700 até 53, medidos no Windows com o llama.cpp. A AMD classifica esses números como preliminares.
Forte no planejamento, mais fraco na interface
A Meta compara o Muse Glimmer com o Gemma4-31B do Google e o Qwen3.6-27B da Alibaba. Quando o modelo utiliza ferramentas e elabora planos em várias etapas, ele apresenta um desempenho claramente superior. Ele obtém 75,5 no MCP Atlas, contra 54,2 e 62,5, e 74,6 no DeepSearch QA, contra 61,7 e 71,1.
O Qwen se destaca em outros aspectos. Ao operar uma interface de desktop real, a pontuação é de 65,9 contra 75,6; no terminal, de 51,7 contra 60,7. E no teste de segurança Siren AgentDojo, que mede a facilidade com que um modelo pode ser manipulado por instruções ocultas em documentos externos, a taxa de sucesso de ataque de 28,4% do Muse Glimmer supera a do Qwen, mas fica atrás da do Gemma4, com 25,6%. Vale a pena ter isso em mente antes de direcionar o modelo para seus próprios arquivos e e-mails.
Como obtê-lo
Quatro pacotes estão disponíveis no Hugging Face: o modelo base com pesos BF16 completos, arquivos GGUF para llama.cpp, compilações do ExecuTorch para dispositivos Apple e o auxiliar DFlash. A maneira mais fácil é pelo LM Studio, onde o modelo aparece nos resultados de pesquisa. A AMD recomenda mais de 32 GB de memória de vídeo ou uma alocação equivalente de memória do sistema para isso. Caso disponha de menos, provedores como o Unsloth oferecem quantizações menores, mas, nesse caso, será necessário transferir parte do modelo para a memória comum do sistema, o que acarreta uma perda perceptível de velocidade. A comunidade agiu rapidamente. Menos de um dia após o lançamento, já havia 57 quantizações adicionais e seis ajustes de precisão disponíveis. Experimentá-lo em um navegador, da mesma forma que era possível com o Kimi K3, não é uma opção neste caso. Sem o hardware adequado, o Muse Glimmer permanece fora de alcance.
Fonte(s)
Os Top 10
» Os Top 10 Portáteis Multimídia
» Os Top 10 Portáteis de Jogos
» Os Top 10 Portáteis Leves para Jogos
» Os Top 10 Portáteis Acessíveis de Escritório/Empresariais
» Os Top 10 Portáteis Premium de Escritório/Empresariais
» Os Top 10 dos Portáteis Workstation
» Os Top 10 Subportáteis
» Os Top 10 Ultrabooks
» Os Top 10 Conversíveis
» Os Top 10 Tablets
» Os Top 10 Smartphones
» A melhores Telas de Portáteis Analisadas Pela Notebookcheck
» Top 10 dos portáteis abaixo dos 500 Euros da Notebookcheck
» Top 10 dos Portáteis abaixo dos 300 Euros






