1. MiniMax-H3 por MiniMaxAI

image-text-to-video · diffusers · Curtidas: 3574 · Downloads: 59368 · Ver no Hugging Face →

Tags: diffusers, safetensors, texto-para-vídeo, imagem-para-vídeo, imagem-e-texto-para-vídeo, vídeo-para-vídeo, texto-para-áudio-vídeo

O que é. MiniMax-H3 é um modelo multimodal da biblioteca diffusers cujo pipeline principal é imagem-e-texto-para-vídeo, com tags que também cobrem geração de áudio-vídeo sincronizado a partir de entradas de texto, imagem, vídeo, áudio e referências.

Por que está em alta. Está em alta esta semana com uma pontuação de tendência de 1346, respaldado por um forte engajamento da comunidade, com 3.574 curtidas e mais de 59.368 downloads.

Para quem é indicado. Desenvolvedores e pesquisadores que criam pipelines de geração multimodal e precisam gerar saídas de áudio-vídeo sincronizadas a partir de combinações de texto, imagens, vídeo, áudio ou entradas de referência.

2. Muse-Glimmer-30B por meta-models

image-text-to-text · transformers · Curtidas: 1097 · Downloads: 0 · Ver no Hugging Face →

Tags: transformers, safetensors, muse_glimmer, imagem-e-texto-para-texto, conversacional, arxiv:2504.13181, arxiv:2602.06036

O que é. Muse-Glimmer-30B é um modelo multimodal de 30 bilhões de parâmetros da meta-models, projetado para geração de imagem-e-texto-para-texto e tarefas conversacionais.

Por que está em alta. Está em alta esta semana devido ao forte interesse da comunidade, evidenciado por mais de 1.000 curtidas e uma alta pontuação de tendência, além da sua licença Apache 2.0 aberta e dos artigos de pesquisa associados vinculados para a tarefa de imagem-e-texto-para-texto.

Para quem é indicado. Desenvolvedores e pesquisadores que criam aplicações conversacionais multimodais que processam entradas combinadas de imagem e texto são o público-alvo deste modelo.

3. DeepSeek-V4-Flash-0731 por deepseek-ai

text-generation · transformers · Curtidas: 3150 · Downloads: 1048685 · Ver no Hugging Face →

Tags: transformers, safetensors, deepseek_v4, geração de texto, conversacional, arxiv:2606.19348, license:mit

O que é. DeepSeek-V4-Flash-0731 é um modelo de geração de texto na modalidade conversacional, construído na biblioteca transformers e disponível nos formatos fp8 e quantizado de 8 bits.

Por que está em alta. Já ultrapassou 1 milhão de downloads e obteve 3.150 curtidas, com uma pontuação de tendência de 668, indicando forte e rápida adoção pela comunidade esta semana.

Para quem é indicado. Desenvolvedores e equipes que buscam um modelo de geração de texto quantizado e implantável para aplicações conversacionais — especialmente em endpoints do Azure — devem considerar este modelo.

4. MiniMax-H3-Turbo-Lora por larryvrh

text-to-video · Curtidas: 651 · Downloads: 0 · Ver no Hugging Face →

Tags: texto-para-vídeo, texto-para-áudio, áudio-vídeo, lora, minimax-h3, comfyui, base_model:Comfy-Org/MiniMax-H3

O que é. É um adaptador LoRA para o modelo MiniMax-H3 que realiza geração de texto-para-vídeo com capacidades associadas de áudio-vídeo via ComfyUI.

Por que está em alta. É notável esta semana por gerar um forte engajamento da comunidade, com 651 curtidas e uma alta pontuação de tendência de 612, apesar de não haver downloads registrados.

Para quem é indicado. Destina-se a criadores e desenvolvedores que trabalham com o ComfyUI e desejam usar um LoRA baseado no MiniMax-H3 para fluxos de trabalho de texto-para-vídeo e texto-para-áudio.

5. MiniMax-H3 por Comfy-Org

Model · diffusion-single-file · Curtidas: 1212 · Downloads: 6798796 · Ver no Hugging Face →

Tags: diffusion-single-file, comfyui, base_model:MiniMaxAI/MiniMax-H3, base_model:finetune:MiniMaxAI/MiniMax-H3

O que é. MiniMax-H3 é um modelo de difusão de arquivo único desenvolvido pela Comfy-Org para uso com a interface ComfyUI, para realizar tarefas de geração de imagens.

Por que está em alta. Atualmente possui uma pontuação de tendência no Hugging Face de 535, além de mais de 6,7 milhões de downloads e mais de 1.200 curtidas da comunidade, refletindo forte adoção recente pelos usuários.

Para quem é indicado. É adequado para usuários do ComfyUI que buscam um modelo de difusão portátil e de fácil configuração para executar fluxos de trabalho de geração de imagens sem necessidade de uma configuração extensa.

6. Kimi-K3 por moonshotai

image-text-to-text · transformers · Curtidas: 10526 · Downloads: 1565484 · Ver no Hugging Face →

Tags: transformers, safetensors, kimi_k3, extração de características, tensores comprimidos, conversacional, imagem-e-texto-para-texto

O que é. Kimi-K3 é um modelo multimodal imagem-e-texto-para-texto desenvolvido pela moonshotai que aceita entradas de imagem e texto para gerar saídas de texto.

Por que está em alta. Está em alta esta semana devido ao seu alto engajamento de usuários no Hugging Face, com mais de 1,56 milhão de downloads, mais de 10,5 mil curtidas e uma pontuação de tendência de 385.

Para quem é indicado. Desenvolvedores que criam aplicações de geração de texto multimodal que combinam entradas de imagem e texto — incluindo casos de uso conversacionais e de análise de conteúdo visual — devem usar este modelo.

7. LFM2.5-2.6B por LiquidAI

text-generation · transformers · Curtidas: 550 · Downloads: 93668 · Ver no Hugging Face →

Tags: transformers, safetensors, lfm2, geração de texto, liquid, lfm2.5, borda, conversacional, ar, zh, en, fr, de, hi, id

O que é. LFM2.5-2.6B é um modelo de geração de texto de 2,6 bilhões de parâmetros da LiquidAI, ajustado a partir do LFM2.5-2.6B-Base para uso conversacional em vários idiomas.

Por que está em alta. Está ganhando atenção esta semana com uma alta pontuação de tendência de 373, 550 curtidas e mais de 93,6 mil downloads, refletindo o forte interesse pelo seu design focado em borda e multilíngue.

Para quem é indicado. Desenvolvedores e pesquisadores que criam aplicações de IA conversacional multilíngue, especialmente aquelas voltadas para cenários de implantação em borda.

8. Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF por DavidAU

image-text-to-text · Curtidas: 1898 · Downloads: 2521093 · Ver no Hugging Face →

Tags: gguf, unsloth, ajuste fino, heretic, sem censura, abliterado, ara, MTP GGUF Quants, Regular GGUF Quants, qwen3.6

O que é. É um modelo de linguagem quantizado em GGUF de 27 bilhões de parâmetros, ajustado a partir do Qwen3.6, configurado para conversação imagem-e-texto-para-texto, raciocínio, redação criativa e tarefas de programação.

Por que está em alta. Acumulou mais de 2,5 milhões de downloads e quase 1,9 mil curtidas, além de uma alta pontuação de tendência, refletindo o forte interesse da comunidade pelo seu ajuste fino sem censura de múltiplos estágios da base Qwen3.6.

Para quem é indicado. Escritores criativos, roleplayers e desenvolvedores que buscam um modelo conversacional multilíngue irrestrito, com capacidade de raciocínio e compreensão de imagem e texto.

9. Minimax-h3-Turbo por lightx2v

image-to-video · diffusers · Curtidas: 341 · Downloads: 20376 · Ver no Hugging Face →

Tags: diffusers, t2v, i2v, r2v, imagem-para-vídeo, en, zh, base_model:MiniMaxAI/MiniMax-H3

O que é. Minimax-h3-Turbo é um modelo baseado na biblioteca Diffusers, marcado para geração de imagem-para-vídeo (com tags adicionais de texto-para-vídeo e referência-para-vídeo), que é um ajuste fino do modelo base MiniMax-H3.

Por que está em alta. Está ganhando tração esta semana com uma pontuação de tendência de 327, respaldado por 341 curtidas e mais de 20 mil downloads no Hugging Face Hub.

Para quem é indicado. Desenvolvedores e pesquisadores que usam a biblioteca Diffusers e precisam de um modelo de geração de vídeo condicionado a imagens derivado da base MiniMax-H3.

10. Muse-Glimmer-30B-GGUF por unsloth

image-text-to-text · transformers · Curtidas: 305 · Downloads: 0 · Ver no Hugging Face →

Tags: transformers, gguf, unsloth, meta, imagem-e-texto-para-texto, arxiv:2504.13181, arxiv:2602.06036

O que é. É um modelo de visão e linguagem quantizado em GGUF de 30 bilhões de parâmetros, que realiza geração de texto a partir de imagem e texto, derivado do modelo base Muse-Glimmer-30B da Meta e publicado pela Unsloth sob a licença Apache-2.0.

Por que está em alta. Está subindo nas tabelas de tendência do Hugging Face esta semana com uma alta pontuação de tendência de 301 e 305 curtidas, impulsionado pelo interesse da comunidade na versão GGUF da Unsloth do modelo de 30 bilhões de parâmetros de imagem-e-texto-para-texto.

Para quem é indicado. Desenvolvedores e entusiastas que desejam executar um modelo multimodal quantizado, implantável localmente, que aceita imagens e texto e produz respostas de texto conversacionais.