1. MiniMax-H3 de MiniMaxAI
image-text-to-video · diffusers · Me gusta: 3574 · Descargas: 59368 · Ver en Hugging Face →
Etiquetas: diffusers, safetensors, text-to-video, image-to-video, image-text-to-video, video-to-video, text-to-audio-video
Qué es. MiniMax-H3 es un modelo multimodal de la biblioteca diffusers cuyo pipeline principal es image-text-to-video (imagen y texto a video), con etiquetas que también cubren la generación sincronizada de audio y video a partir de entradas de texto, imagen, video, audio y referencia.
Por qué está en tendencia. Está en tendencia esta semana con una puntuación de tendencia de 1346, respaldado por una fuerte participación comunitaria de 3.574 me gusta y más de 59.000 descargas.
Quién debería usarlo. Desarrolladores e investigadores que construyen pipelines de generación multimodal y necesitan producir salidas sincronizadas de audio y video a partir de combinaciones de texto, imágenes, video, audio o entradas de referencia.
2. Muse-Glimmer-30B de meta-models
image-text-to-text · transformers · Me gusta: 1097 · Descargas: 0 · Ver en Hugging Face →
Etiquetas: transformers, safetensors, muse_glimmer, image-text-to-text, conversational, arxiv:2504.13181, arxiv:2602.06036
Qué es. Muse-Glimmer-30B es un modelo multimodal de 30 mil millones de parámetros de meta-models, diseñado para generación de imagen y texto a texto y tareas conversacionales.
Por qué está en tendencia. Está en tendencia esta semana debido al fuerte interés de la comunidad, evidenciado por más de 1.000 me gusta y una alta puntuación de tendencia, combinado con su licencia abierta Apache 2.0 y los artículos de investigación asociados para la tarea de imagen y texto a texto.
Quién debería usarlo. Desarrolladores e investigadores que construyen aplicaciones conversacionales multimodales que procesan entradas combinadas de imagen y texto son el público objetivo de este modelo.
3. DeepSeek-V4-Flash-0731 de deepseek-ai
text-generation · transformers · Me gusta: 3150 · Descargas: 1048685 · Ver en Hugging Face →
Etiquetas: transformers, safetensors, deepseek_v4, text-generation, conversational, arxiv:2606.19348, license:mit
Qué es. DeepSeek-V4-Flash-0731 es un modelo de generación de texto en la modalidad conversacional, construido sobre la biblioteca transformers y ofrecido en formatos cuantizados fp8 y de 8 bits.
Por qué está en tendencia. Ha superado el millón de descargas y ha obtenido 3.150 me gusta con una puntuación de tendencia de 668, lo que indica una fuerte y rápida adopción comunitaria esta semana.
Quién debería usarlo. Desarrolladores y equipos que buscan un modelo de generación de texto cuantizado y desplegable para aplicaciones conversacionales —especialmente en endpoints de Azure— deberían considerar este modelo.
4. MiniMax-H3-Turbo-Lora de larryvrh
text-to-video · Me gusta: 651 · Descargas: 0 · Ver en Hugging Face →
Etiquetas: text-to-video, text-to-audio, audio-video, lora, minimax-h3, comfyui, base_model:Comfy-Org/MiniMax-H3
Qué es. Es un adaptador LoRA para el modelo MiniMax-H3 que realiza generación de texto a video con capacidades asociadas de audio y video a través de ComfyUI.
Por qué está en tendencia. Es destacado esta semana por atraer una fuerte participación comunitaria, con 651 me gusta y una alta puntuación de tendencia de 612 a pesar de cero descargas registradas.
Quién debería usarlo. Está destinado a creadores y desarrolladores que trabajan en ComfyUI y desean usar un LoRA basado en MiniMax-H3 para flujos de trabajo de texto a video y texto a audio.
5. MiniMax-H3 de Comfy-Org
Model · diffusion-single-file · Me gusta: 1212 · Descargas: 6798796 · Ver en Hugging Face →
Etiquetas: diffusion-single-file, comfyui, base_model:MiniMaxAI/MiniMax-H3, base_model:finetune:MiniMaxAI/MiniMax-H3
Qué es. MiniMax-H3 es un modelo de difusión de archivo único desarrollado por Comfy-Org para usar con la interfaz de ComfyUI en tareas de generación de imágenes.
Por qué está en tendencia. Actualmente tiene una puntuación de tendencia en Hugging Face de 535, junto con más de 6,7 millones de descargas y más de 1.200 me gusta de la comunidad, lo que refleja una fuerte adopción reciente por parte de los usuarios.
Quién debería usarlo. Es adecuado para usuarios de ComfyUI que buscan un modelo de difusión portátil y de baja fricción para ejecutar flujos de trabajo de generación de imágenes sin una configuración extensa.
6. Kimi-K3 de moonshotai
image-text-to-text · transformers · Me gusta: 10526 · Descargas: 1565484 · Ver en Hugging Face →
Etiquetas: transformers, safetensors, kimi_k3, feature-extraction, compressed-tensors, conversational, image-text-to-text
Qué es. Kimi-K3 es un modelo multimodal de imagen y texto a texto desarrollado por moonshotai que acepta tanto entradas de imagen como de texto para generar salidas de texto.
Por qué está en tendencia. Está en tendencia esta semana debido a su alta participación de usuarios en Hugging Face, con más de 1,56 millones de descargas, más de 10.500 me gusta y una puntuación de tendencia de 385.
Quién debería usarlo. Desarrolladores que construyen aplicaciones de generación de texto multimodal que combinan entradas de imagen y texto, incluyendo casos de uso de análisis conversacional y de contenido visual, deberían usar este modelo.
7. LFM2.5-2.6B de LiquidAI
text-generation · transformers · Me gusta: 550 · Descargas: 93668 · Ver en Hugging Face →
Etiquetas: transformers, safetensors, lfm2, text-generation, liquid, lfm2.5, edge, conversational, ar, zh, en, fr, de, hi, id
Qué es. LFM2.5-2.6B es un modelo de generación de texto de 2.600 millones de parámetros de LiquidAI, ajustado a partir de LFM2.5-2.6B-Base para uso conversacional en múltiples idiomas.
Por qué está en tendencia. Está ganando atención esta semana con una alta puntuación de tendencia de 373, 550 me gusta y más de 93.000 descargas, lo que refleja un fuerte interés en su diseño multilingüe enfocado en edge.
Quién debería usarlo. Desarrolladores e investigadores que construyen aplicaciones de IA conversacional multilingüe, especialmente aquellos que se dirigen a escenarios de despliegue en edge.
8. Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF de DavidAU
image-text-to-text · Me gusta: 1898 · Descargas: 2521093 · Ver en Hugging Face →
Etiquetas: gguf, unsloth, fine tune, heretic, uncensored, abliterated, ara, MTP GGUF Quants, Regular GGUF Quants, qwen3.6
Qué es. Un modelo de lenguaje ajustado de 27 mil millones de parámetros cuantizado en GGUF, basado en Qwen3.6, configurado para conversación de imagen y texto a texto, razonamiento, escritura creativa y tareas de programación.
Por qué está en tendencia. Ha acumulado más de 2,5 millones de descargas y casi 1.900 me gusta junto con una alta puntuación de tendencia, lo que refleja un fuerte interés comunitario en su ajuste fino sin censura en múltiples etapas del modelo base Qwen3.6.
Quién debería usarlo. Escritores creativos, roleplayers y desarrolladores que buscan un modelo conversacional multilingüe sin restricciones, con capacidad de razonamiento y comprensión de imagen y texto.
9. Minimax-h3-Turbo de lightx2v
image-to-video · diffusers · Me gusta: 341 · Descargas: 20376 · Ver en Hugging Face →
Etiquetas: diffusers, t2v, i2v, r2v, image-to-video, en, zh, base_model:MiniMaxAI/MiniMax-H3
Qué es. Minimax-h3-Turbo es un modelo basado en Diffusers etiquetado para generación de imagen a video (con etiquetas adicionales de texto a video y referencia a video) que es un ajuste fino del modelo base MiniMax-H3.
Por qué está en tendencia. Está ganando tracción esta semana con una puntuación de tendencia de 327, respaldado por 341 me gusta y más de 20.000 descargas en el Hub de Hugging Face.
Quién debería usarlo. Desarrolladores e investigadores que utilizan la biblioteca Diffusers y necesitan un modelo de generación de video condicionado por imagen derivado del modelo base MiniMax-H3.
10. Muse-Glimmer-30B-GGUF de unsloth
image-text-to-text · transformers · Me gusta: 305 · Descargas: 0 · Ver en Hugging Face →
Etiquetas: transformers, gguf, unsloth, meta, image-text-to-text, arxiv:2504.13181, arxiv:2602.06036
Qué es. Un modelo vision-language de 30B cuantizado en GGUF que realiza generación de texto a partir de imagen y texto, derivado del modelo base Muse-Glimmer-30B de Meta y publicado por Unsloth bajo la licencia Apache-2.0.
Por qué está en tendencia. Está escalando en las listas de tendencia de Hugging Face esta semana con una alta puntuación de tendencia de 301 y 305 me gusta, impulsado por el interés comunitario en la versión GGUF de Unsloth de un modelo de imagen y texto a texto de 30B.
Quién debería usarlo. Desarrolladores y aficionados que desean ejecutar un modelo multimodal cuantizado y desplegable localmente que acepta imágenes y texto y produce respuestas de texto conversacionales.