1. MiniMax-H3 by MiniMaxAI
Bild-Text-zu-Video · diffusers · Likes: 3574 · Downloads: 59368 · Auf Hugging Face ansehen →
Tags: diffusers, safetensors, text-to-video, image-to-video, image-text-to-video, video-to-video, text-to-audio-video
Was es ist. MiniMax-H3 ist ein multimodales Modell in der diffusers-Bibliothek, dessen primäre Pipeline Bild-Text-zu-Video ist, mit Tags, die auch die synchronisierte Audio-Video-Generierung aus Text-, Bild-, Video-, Audio- und Referenzeingaben abdecken.
Warum es im Trend liegt. Es liegt diese Woche mit einem Trend-Score von 1346 im Trend, gestützt auf eine starke Community-Beteiligung von 3.574 Likes und über 59.000 Downloads.
Wer es verwenden sollte. Entwickler und Forscher, die multimodale Generierungs-Pipelines aufbauen und synchronisierte Audio-Video-Ausgaben aus Kombinationen von Text, Bildern, Video, Audio oder Referenzeingaben erzeugen müssen.
2. Muse-Glimmer-30B by meta-models
Bild-Text-zu-Text · transformers · Likes: 1097 · Downloads: 0 · Auf Hugging Face ansehen →
Tags: transformers, safetensors, muse_glimmer, image-text-to-text, conversational, arxiv:2504.13181, arxiv:2602.06036
Was es ist. Muse-Glimmer-30B ist ein multimodales 30-Milliarden-Parameter-Modell von meta-models, das für die Bild-Text-zu-Text-Generierung und Konversationsaufgaben entwickelt wurde.
Warum es im Trend liegt. Es liegt diese Woche aufgrund des starken Community-Interesses im Trend, belegt durch über 1.000 Likes und einen hohen Trend-Score, gepaart mit seiner offenen Apache-2.0-Lizenz und verlinkten zugehörigen Forschungsarbeiten für die Bild-Text-zu-Text-Aufgabe.
Wer es verwenden sollte. Entwickler und Forscher, die multimodale Konversationsanwendungen aufbauen, die kombinierte Bild- und Texteingaben verarbeiten, sind die Zielgruppe für dieses Modell.
3. DeepSeek-V4-Flash-0731 by deepseek-ai
Textgenerierung · transformers · Likes: 3150 · Downloads: 1048685 · Auf Hugging Face ansehen →
Tags: transformers, safetensors, deepseek_v4, text-generation, conversational, arxiv:2606.19348, license:mit
Was es ist. DeepSeek-V4-Flash-0731 ist ein Textgenerierungsmodell in der Konversationsmodalität, das auf der transformers-Bibliothek aufbaut und in fp8- und 8-Bit-quantisierten Formaten angeboten wird.
Warum es im Trend liegt. Es hat die Marke von einer Million Downloads überschritten und 3.150 Likes mit einem Trend-Score von 668 erzielt, was auf eine starke und schnelle Community-Akzeptanz in dieser Woche hinweist.
Wer es verwenden sollte. Entwickler und Teams, die ein einsetzbares, quantisiertes Textgenerierungsmodell für Konversationsanwendungen suchen – insbesondere auf Azure-Endpunkten – sollten dieses Modell in Betracht ziehen.
4. MiniMax-H3-Turbo-Lora by larryvrh
Text-zu-Video · Likes: 651 · Downloads: 0 · Auf Hugging Face ansehen →
Tags: text-to-video, text-to-audio, audio-video, lora, minimax-h3, comfyui, base_model:Comfy-Org/MiniMax-H3
Was es ist. Es ist ein LoRA-Adapter für das MiniMax-H3-Modell, der Text-zu-Video-Generierung mit zugehörigen Audio-Video-Fähigkeiten über ComfyUI durchführt.
Warum es im Trend liegt. Es ist diese Woche bemerkenswert, da es eine starke Community-Beteiligung mit 651 Likes und einem hohen Trend-Score von 612 trotz null verzeichneten Downloads auf sich zieht.
Wer es verwenden sollte. Es ist für Creator und Entwickler gedacht, die in ComfyUI arbeiten und einen auf MiniMax-H3 basierenden LoRA für Text-zu-Video- und Text-zu-Audio-Workflows einsetzen möchten.
5. MiniMax-H3 by Comfy-Org
Modell · diffusion-single-file · Likes: 1212 · Downloads: 6798796 · Auf Hugging Face ansehen →
Tags: diffusion-single-file, comfyui, base_model:MiniMaxAI/MiniMax-H3, base_model:finetune:MiniMaxAI/MiniMax-H3
Was es ist. MiniMax-H3 ist ein Single-File-Diffusionsmodell, das von Comfy-Org für die Verwendung mit der ComfyUI-Oberfläche zur Durchführung von Bildgenerierungsaufgaben entwickelt wurde.
Warum es im Trend liegt. Es hält derzeit einen Hugging-Face-Trend-Score von 535, neben über 6,7 Millionen Downloads und mehr als 1.200 Community-Likes, was eine starke aktuelle Nutzerakzeptanz widerspiegelt.
Wer es verwenden sollte. Es eignet sich für ComfyUI-Nutzer, die ein portables, reibungsarmes Diffusionsmodell suchen, um Bildgenerierungs-Workflows ohne umfangreiche Einrichtung auszuführen.
6. Kimi-K3 by moonshotai
Bild-Text-zu-Text · transformers · Likes: 10526 · Downloads: 1565484 · Auf Hugging Face ansehen →
Tags: transformers, safetensors, kimi_k3, feature-extraction, compressed-tensors, conversational, image-text-to-text
Was es ist. Kimi-K3 ist ein multimodales Bild-Text-zu-Text-Modell, das von moonshotai entwickelt wurde und sowohl Bild- als auch Texteingaben akzeptiert, um Textausgaben zu erzeugen.
Warum es im Trend liegt. Es liegt diese Woche aufgrund der hohen Hugging-Face-Nutzerbeteiligung mit über 1,56 Millionen Downloads, mehr als 10.500 Likes und einem Trend-Score von 385 im Trend.
Wer es verwenden sollte. Entwickler, die multimodale Textgenerierungsanwendungen aufbauen, die Bild- und Texteingaben kombinieren, einschließlich Konversations- und Anwendungsfällen zur Analyse visueller Inhalte, sollten dieses Modell verwenden.
7. LFM2.5-2.6B by LiquidAI
Textgenerierung · transformers · Likes: 550 · Downloads: 93668 · Auf Hugging Face ansehen →
Tags: transformers, safetensors, lfm2, text-generation, liquid, lfm2.5, edge, conversational, ar, zh, en, fr, de, hi, id
Was es ist. LFM2.5-2.6B ist ein Textgenerierungsmodell mit 2,6B-Parametern von LiquidAI, das aus LFM2.5-2.6B-Base für den mehrsprachigen konversationellen Einsatz feinabgestimmt wurde.
Warum es im Trend liegt. Es gewinnt diese Woche mit einem hohen Trend-Score von 373, 550 Likes und über 93.000 Downloads an Aufmerksamkeit, was das starke Interesse an seinem auf Edge ausgerichteten, mehrsprachigen Design widerspiegelt.
Wer es verwenden sollte. Entwickler und Forscher, die mehrsprachige Konversations-KI-Anwendungen aufbauen, insbesondere solche, die auf Edge-Deployment-Szenarien abzielen.
8. Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF by DavidAU
Bild-Text-zu-Text · Likes: 1898 · Downloads: 2521093 · Auf Hugging Face ansehen →
Tags: gguf, unsloth, fine tune, heretic, uncensored, abliterated, ara, MTP GGUF Quants, Regular GGUF Quants, qwen3.6
Was es ist. Ein GGUF-quantisiertes feinabgestimmtes Sprachmodell mit 27B-Parametern auf Basis von Qwen3.6, konfiguriert für Bild-Text-zu-Text-Konversation, Reasoning, kreatives Schreiben und Coding-Aufgaben.
Warum es im Trend liegt. Es hat über 2,5 Millionen Downloads und fast 1.900 Likes neben einem hohen Trend-Score angesammelt, was das starke Community-Interesse an seinem mehrstufigen unzensierten Fine-Tune der Qwen3.6-Basis widerspiegelt.
Wer es verwenden sollte. Kreative Schreiber, Rollenspieler und Entwickler, die ein uneingeschränktes, mehrsprachiges Konversationsmodell mit Reasoning und Bild-Text-Verständnis suchen.
9. Minimax-h3-Turbo by lightx2v
Bild-zu-Video · diffusers · Likes: 341 · Downloads: 20376 · Auf Hugging Face ansehen →
Tags: diffusers, t2v, i2v, r2v, image-to-video, en, zh, base_model:MiniMaxAI/MiniMax-H3
Was es ist. Minimax-h3-Turbo ist ein Diffusers-basiertes Modell, das für Bild-zu-Video-Generierung getaggt ist (mit zusätzlichen Text-zu-Video- und Referenz-zu-Video-Tags) und ein Finetune des MiniMax-H3-Basismodells ist.
Warum es im Trend liegt. Es gewinnt diese Woche mit einem Trend-Score von 327 an Zugkraft, unterstützt durch 341 Likes und mehr als 20.000 Downloads auf dem Hugging Face Hub.
Wer es verwenden sollte. Entwickler und Forscher, die die Diffusers-Bibliothek verwenden und ein bildkonditioniertes Videogenerierungsmodell benötigen, das von der MiniMax-H3-Basis abgeleitet ist.
10. Muse-Glimmer-30B-GGUF by unsloth
Bild-Text-zu-Text · transformers · Likes: 305 · Downloads: 0 · Auf Hugging Face ansehen →
Tags: transformers, gguf, unsloth, meta, image-text-to-text, arxiv:2504.13181, arxiv:2602.06036
Was es ist. Ein GGUF-quantisiertes 30B-Vision-Language-Modell, das Bild-und-Text-zu-Text-Generierung durchführt, abgeleitet von Metas Muse-Glimmer-30B-Basismodell und von Unsloth unter der Apache-2.0-Lizenz veröffentlicht.
Warum es im Trend liegt. Es steigt diese Woche mit einem hohen Trend-Score von 301 und 305 Likes in den Hugging-Face-Trend-Charts auf, angetrieben durch das Community-Interesse an Unsloths GGUF-Build eines 30B Bild-Text-zu-Text-Modells.
Wer es verwenden sollte. Entwickler und Hobbyisten, die ein quantisiertes, lokal einsetzbares multimodales Modell betreiben möchten, das Bilder und Text akzeptiert und konversationelle Textantworten erzeugt.