1. MiniMax-H3 par MiniMaxAI
image-text-to-video · diffusers · J'aime : 3574 · Téléchargements : 59368 · Voir sur Hugging Face →
Tags : diffusers, safetensors, text-to-video, image-to-video, image-text-to-video, video-to-video, text-to-audio-video
Ce que c'est. MiniMax-H3 est un modèle multimodal de la bibliothèque diffusers dont le pipeline principal est image-text-to-video, avec des tags couvrant également la génération audio-vidéo synchronisée à partir d'entrées texte, image, vidéo, audio et de référence.
Pourquoi il est tendance. Il est tendance cette semaine avec un score de tendance de 1346, soutenu par un fort engagement communautaire de 3 574 j'aime et plus de 59 000 téléchargements.
À qui s'adresse-t-il. Les développeurs et chercheurs construisant des pipelines de génération multimodaux qui ont besoin de produire des sorties audio-vidéo synchronisées à partir de combinaisons d'entrées texte, image, vidéo, audio ou de référence.
2. Muse-Glimmer-30B par meta-models
image-text-to-text · transformers · J'aime : 1097 · Téléchargements : 0 · Voir sur Hugging Face →
Tags : transformers, safetensors, muse_glimmer, image-text-to-text, conversational, arxiv:2504.13181, arxiv:2602.06036
Ce que c'est. Muse-Glimmer-30B est un modèle multimodal de 30 milliards de paramètres de meta-models conçu pour la génération image-text-to-text et les tâches conversationnelles.
Pourquoi il est tendance. Il est tendance cette semaine en raison du fort intérêt de la communauté, attesté par plus de 1 000 j'aime et un score de tendance élevé, associé à sa licence open source Apache 2.0 et aux articles de recherche liés pour la tâche image-text-to-text.
À qui s'adresse-t-il. Les développeurs et chercheurs construisant des applications conversationnelles multimodales qui traitent des entrées combinées image et texte sont le public cible de ce modèle.
3. DeepSeek-V4-Flash-0731 par deepseek-ai
text-generation · transformers · J'aime : 3150 · Téléchargements : 1048685 · Voir sur Hugging Face →
Tags : transformers, safetensors, deepseek_v4, text-generation, conversational, arxiv:2606.19348, license:mit
Ce que c'est. DeepSeek-V4-Flash-0731 est un modèle de génération de texte dans la modalité conversationnelle, construit sur la bibliothèque transformers et proposé aux formats quantifiés fp8 et 8 bits.
Pourquoi il est tendance. Il a dépassé le million de téléchargements et obtenu 3 150 j'aime avec un score de tendance de 668, indiquant une adoption communautaire forte et rapide cette semaine.
À qui s'adresse-t-il. Les développeurs et équipes recherchant un modèle de génération de texte quantifié déployable pour des applications conversationnelles — en particulier sur des points de terminaison Azure — devraient envisager ce modèle.
4. MiniMax-H3-Turbo-Lora par larryvrh
text-to-video · J'aime : 651 · Téléchargements : 0 · Voir sur Hugging Face →
Tags : text-to-video, text-to-audio, audio-video, lora, minimax-h3, comfyui, base_model:Comfy-Org/MiniMax-H3
Ce que c'est. Il s'agit d'un adaptateur LoRA pour le modèle MiniMax-H3 qui effectue la génération text-to-video avec des capacités audio-vidéo associées via ComfyUI.
Pourquoi il est tendance. Il est notable cette semaine pour avoir suscité un fort engagement communautaire, avec 651 j'aime et un score de tendance élevé de 612 malgré zéro téléchargement enregistré.
À qui s'adresse-t-il. Il est destiné aux créateurs et développeurs travaillant dans ComfyUI qui souhaitent utiliser un LoRA basé sur MiniMax-H3 pour des flux de travail text-to-video et text-to-audio.
5. MiniMax-H3 par Comfy-Org
Modèle · diffusion-single-file · J'aime : 1212 · Téléchargements : 6798796 · Voir sur Hugging Face →
Tags : diffusion-single-file, comfyui, base_model:MiniMaxAI/MiniMax-H3, base_model:finetune:MiniMaxAI/MiniMax-H3
Ce que c'est. MiniMax-H3 est un modèle de diffusion en fichier unique développé par Comfy-Org pour être utilisé avec l'interface ComfyUI afin d'effectuer des tâches de génération d'images.
Pourquoi il est tendance. Il détient actuellement un score de tendance Hugging Face de 535, avec plus de 6,7 millions de téléchargements et plus de 1 200 j'aime de la communauté, reflétant une forte adoption récente par les utilisateurs.
À qui s'adresse-t-il. Il convient aux utilisateurs de ComfyUI à la recherche d'un modèle de diffusion portable et simple à mettre en œuvre pour exécuter des flux de travail de génération d'images sans configuration étendue.
6. Kimi-K3 par moonshotai
image-text-to-text · transformers · J'aime : 10526 · Téléchargements : 1565484 · Voir sur Hugging Face →
Tags : transformers, safetensors, kimi_k3, feature-extraction, compressed-tensors, conversational, image-text-to-text
Ce que c'est. Kimi-K3 est un modèle multimodal image-text-to-text développé par moonshotai qui accepte à la fois des entrées image et texte pour générer des sorties texte.
Pourquoi il est tendance. Il est tendance cette semaine en raison du fort engagement des utilisateurs Hugging Face, avec plus de 1,56 million de téléchargements, plus de 10 500 j'aime, et un score de tendance de 385.
À qui s'adresse-t-il. Les développeurs construisant des applications de génération de texte multimodal combinant entrées image et texte, y compris les cas d'utilisation conversationnels et d'analyse de contenu visuel, devraient utiliser ce modèle.
7. LFM2.5-2.6B par LiquidAI
text-generation · transformers · J'aime : 550 · Téléchargements : 93668 · Voir sur Hugging Face →
Tags : transformers, safetensors, lfm2, text-generation, liquid, lfm2.5, edge, conversational, ar, zh, en, fr, de, hi, id
Ce que c'est. LFM2.5-2.6B est un modèle de génération de texte de 2,6 milliards de paramètres de LiquidAI, affiné à partir de LFM2.5-2.6B-Base pour un usage conversationnel dans de nombreuses langues.
Pourquoi il est tendance. Il attire l'attention cette semaine avec un score de tendance élevé de 373, 550 j'aime, et plus de 93 000 téléchargements, reflétant un fort intérêt pour sa conception multilingue axée sur l'edge.
À qui s'adresse-t-il. Les développeurs et chercheurs construisant des applications d'IA conversationnelle multilingues, en particulier ceux ciblant des scénarios de déploiement en périphérie.
8. Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF par DavidAU
image-text-to-text · J'aime : 1898 · Téléchargements : 2521093 · Voir sur Hugging Face →
Tags : gguf, unsloth, fine tune, heretic, uncensored, abliterated, ara, MTP GGUF Quants, Regular GGUF Quants, qwen3.6
Ce que c'est. Un modèle de langage affiné de 27 milliards de paramètres quantifié en GGUF, basé sur Qwen3.6, configuré pour la conversation image-text-to-text, le raisonnement, l'écriture créative et les tâches de codage.
Pourquoi il est tendance. Il a accumulé plus de 2,5 millions de téléchargements et près de 1 900 j'aime avec un score de tendance élevé, reflétant un fort intérêt communautaire pour son affinage non censuré multi-étapes de la base Qwen3.6.
À qui s'adresse-t-il. Les écrivains créatifs, joueurs de rôle et développeurs à la recherche d'un modèle conversationnel multilingue sans restriction avec raisonnement et compréhension image-texte.
9. Minimax-h3-Turbo par lightx2v
image-to-video · diffusers · J'aime : 341 · Téléchargements : 20376 · Voir sur Hugging Face →
Tags : diffusers, t2v, i2v, r2v, image-to-video, en, zh, base_model:MiniMaxAI/MiniMax-H3
Ce que c'est. Minimax-h3-Turbo est un modèle basé sur Diffusers étiqueté pour la génération image-to-video (avec des tags supplémentaires text-to-video et reference-to-video) qui est un affinage du modèle de base MiniMax-H3.
Pourquoi il est tendance. Il gagne du terrain cette semaine avec un score de tendance de 327, soutenu par 341 j'aime et plus de 20 000 téléchargements sur le Hugging Face Hub.
À qui s'adresse-t-il. Les développeurs et chercheurs utilisant la bibliothèque Diffusers qui ont besoin d'un modèle de génération vidéo conditionné par image dérivé de la base MiniMax-H3.
10. Muse-Glimmer-30B-GGUF par unsloth
image-text-to-text · transformers · J'aime : 305 · Téléchargements : 0 · Voir sur Hugging Face →
Tags : transformers, gguf, unsloth, meta, image-text-to-text, arxiv:2504.13181, arxiv:2602.06036
Ce que c'est. Un modèle vision-langage de 30B quantifié en GGUF qui effectue la génération image-et-texte vers texte, dérivé du modèle de base Muse-Glimmer-30B de Meta et publié par Unsloth sous la licence Apache-2.0.
Pourquoi il est tendance. Il grimpe dans les classements des tendances Hugging Face cette semaine avec un score de tendance élevé de 301 et 305 j'aime, porté par l'intérêt de la communauté pour la build GGUF d'Unsloth d'un modèle image-text-to-text de 30B.
À qui s'adresse-t-il. Les développeurs et amateurs qui souhaitent exécuter un modèle multimodal quantifié déployable localement qui accepte images plus texte et produit des réponses textuelles conversationnelles.