1. MiniMax-H3 oleh MiniMaxAI
image-text-to-video · diffusers · Suka: 3574 · Unduhan: 59368 · Lihat di Hugging Face →
Tag: diffusers, safetensors, text-to-video, image-to-video, image-text-to-video, video-to-video, text-to-audio-video
Apa itu. MiniMax-H3 adalah model multimodal dalam pustaka diffusers yang pipeline utamanya adalah image-text-to-video, dengan tag yang juga mencakup pembuatan audio-video tersinkronisasi dari input teks, gambar, video, audio, dan referensi.
Mengapa trending. Model ini trending minggu ini dengan skor trending 1346, didukung oleh keterlibatan komunitas yang kuat sebanyak 3.574 suka dan lebih dari 59.000 unduhan.
Siapa yang harus menggunakannya. Pengembang dan peneliti yang membangun pipeline pembangkitan multimodal dan perlu menghasilkan output audio-video tersinkronisasi dari kombinasi input teks, gambar, video, audio, atau referensi.
2. Muse-Glimmer-30B oleh meta-models
image-text-to-text · transformers · Suka: 1097 · Unduhan: 0 · Lihat di Hugging Face →
Tag: transformers, safetensors, muse_glimmer, image-text-to-text, conversational, arxiv:2504.13181, arxiv:2602.06036
Apa itu. Muse-Glimmer-30B adalah model multimodal berparameter 30 miliar dari meta-models yang dirancang untuk pembangkitan image-text-to-text dan tugas percakapan.
Mengapa trending. Model ini trending minggu ini karena tingginya minat komunitas, dibuktikan dengan lebih dari 1.000 suka dan skor trending yang tinggi, dipadukan dengan lisensi Apache 2.0 terbuka dan makalah penelitian terkait yang ditautkan untuk tugas image-text-to-text.
Siapa yang harus menggunakannya. Pengembang dan peneliti yang membangun aplikasi percakapan multimodal yang memproses input gambar dan teks gabungan adalah target audiens untuk model ini.
3. DeepSeek-V4-Flash-0731 oleh deepseek-ai
text-generation · transformers · Suka: 3150 · Unduhan: 1048685 · Lihat di Hugging Face →
Tag: transformers, safetensors, deepseek_v4, text-generation, conversational, arxiv:2606.19348, license:mit
Apa itu. DeepSeek-V4-Flash-0731 adalah model text-generation dalam modalitas percakapan, dibangun di atas pustaka transformers dan ditawarkan dalam format fp8 serta terkuantisasi 8-bit.
Mengapa trending. Model ini telah melampaui satu juta unduhan dan meraih 3.150 suka dengan skor trending 668, menunjukkan adopsi komunitas yang kuat dan cepat minggu ini.
Siapa yang harus menggunakannya. Pengembang dan tim yang mencari model text-generation terkuantisasi yang dapat di-deploy untuk aplikasi percakapan—terutama pada endpoint Azure—seharusnya mempertimbangkan model ini.
4. MiniMax-H3-Turbo-Lora oleh larryvrh
text-to-video · Suka: 651 · Unduhan: 0 · Lihat di Hugging Face →
Tag: text-to-video, text-to-audio, audio-video, lora, minimax-h3, comfyui, base_model:Comfy-Org/MiniMax-H3
Apa itu. Ini adalah adapter LoRA untuk model MiniMax-H3 yang melakukan pembangkitan text-to-video dengan kemampuan audio-video terkait melalui ComfyUI.
Mengapa trending. Model ini patut diperhatikan minggu ini karena menarik keterlibatan komunitas yang kuat, dengan 651 suka dan skor trending tinggi 612 meskipun tidak ada unduhan yang tercatat.
Siapa yang harus menggunakannya. Diperuntukkan bagi kreator dan pengembang yang bekerja di ComfyUI dan ingin menggunakan LoRA berbasis MiniMax-H3 untuk alur kerja text-to-video dan text-to-audio.
5. MiniMax-H3 oleh Comfy-Org
Model · diffusion-single-file · Suka: 1212 · Unduhan: 6798796 · Lihat di Hugging Face →
Tag: diffusion-single-file, comfyui, base_model:MiniMaxAI/MiniMax-H3, base_model:finetune:MiniMaxAI/MiniMax-H3
Apa itu. MiniMax-H3 adalah model difusi single-file yang dikembangkan oleh Comfy-Org untuk digunakan dengan antarmuka ComfyUI guna melakukan tugas pembangkitan gambar.
Mengapa trending. Saat ini model ini memiliki skor trending Hugging Face sebesar 535, bersama dengan lebih dari 6,7 juta unduhan dan lebih dari 1.200 suka komunitas, mencerminkan adopsi pengguna baru-baru ini yang kuat.
Siapa yang harus menggunakannya. Cocok untuk pengguna ComfyUI yang mencari model difusi portabel dan ringan untuk menjalankan alur kerja pembangkitan gambar tanpa pengaturan yang rumit.
6. Kimi-K3 oleh moonshotai
image-text-to-text · transformers · Suka: 10526 · Unduhan: 1565484 · Lihat di Hugging Face →
Tag: transformers, safetensors, kimi_k3, feature-extraction, compressed-tensors, conversational, image-text-to-text
Apa itu. Kimi-K3 adalah model multimodal image-text-to-text yang dikembangkan oleh moonshotai yang menerima input gambar dan teks untuk menghasilkan output teks.
Mengapa trending. Model ini trending minggu ini karena tingginya keterlibatan pengguna Hugging Face, dengan lebih dari 1,56 juta unduhan, lebih dari 10.500 suka, dan skor trending 385.
Siapa yang harus menggunakannya. Pengembang yang membangun aplikasi pembangkitan teks multimodal yang menggabungkan input gambar dan teks, termasuk kasus penggunaan percakapan dan analisis konten visual, sebaiknya menggunakan model ini.
7. LFM2.5-2.6B oleh LiquidAI
text-generation · transformers · Suka: 550 · Unduhan: 93668 · Lihat di Hugging Face →
Tag: transformers, safetensors, lfm2, text-generation, liquid, lfm2.5, edge, conversational, ar, zh, en, fr, de, hi, id
Apa itu. LFM2.5-2.6B adalah model text-generation berparameter 2,6B dari LiquidAI, di-fine-tune dari LFM2.5-2.6B-Base untuk penggunaan percakapan dalam berbagai bahasa.
Mengapa trending. Model ini mendapat perhatian minggu ini dengan skor trending tinggi 373, 550 suka, dan lebih dari 93.000 unduhan, mencerminkan minat yang kuat terhadap desain multibahasa yang berfokus pada edge.
Siapa yang harus menggunakannya. Pengembang dan peneliti yang membangun aplikasi AI percakapan multibahasa, terutama yang menargetkan skenario deployment edge.
8. Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF oleh DavidAU
image-text-to-text · Suka: 1898 · Unduhan: 2521093 · Lihat di Hugging Face →
Tag: gguf, unsloth, fine tune, heretic, uncensored, abliterated, ara, MTP GGUF Quants, Regular GGUF Quants, qwen3.6
Apa itu. Model bahasa yang di-fine-tune berparameter 27B dengan kuantisasi GGUF berbasis Qwen3.6, dikonfigurasi untuk percakapan image-text-to-text, penalaran, penulisan kreatif, dan tugas coding.
Mengapa trending. Model ini telah mengakumulasi lebih dari 2,5 juta unduhan dan hampir 1.900 suka disamping skor trending yang tinggi, mencerminkan minat komunitas yang kuat terhadap fine-tune uncensored multi-tahap dari basis Qwen3.6.
Siapa yang harus menggunakannya. Penulis kreatif, roleplayer, dan pengembang yang mencari model percakapan multibahasa tanpa batasan dengan kemampuan penalaran dan pemahaman gambar-teks.
9. Minimax-h3-Turbo oleh lightx2v
image-to-video · diffusers · Suka: 341 · Unduhan: 20376 · Lihat di Hugging Face →
Tag: diffusers, t2v, i2v, r2v, image-to-video, en, zh, base_model:MiniMaxAI/MiniMax-H3
Apa itu. Minimax-h3-Turbo adalah model berbasis Diffusers yang diberi tag untuk pembangkitan image-to-video (dengan tag text-to-video dan reference-to-video tambahan) yang merupakan finetune dari model basis MiniMax-H3.
Mengapa trending. Model ini semakin diminati minggu ini dengan skor trending 327, didukung oleh 341 suka dan lebih dari 20.000 unduhan di Hugging Face Hub.
Siapa yang harus menggunakannya. Pengembang dan peneliti yang menggunakan pustaka Diffusers dan membutuhkan model pembangkitan video berbasis gambar yang diturunkan dari basis MiniMax-H3.
10. Muse-Glimmer-30B-GGUF oleh unsloth
image-text-to-text · transformers · Suka: 305 · Unduhan: 0 · Lihat di Hugging Face →
Tag: transformers, gguf, unsloth, meta, image-text-to-text, arxiv:2504.13181, arxiv:2602.06036
Apa itu. Model bahasa-visi 30B dengan kuantisasi GGUF yang melakukan pembangkitan teks dari gambar-dan-teks, diturunkan dari model basis Muse-Glimmer-30B milik Meta dan dipublikasikan oleh Unsloth di bawah lisensi Apache-2.0.
Mengapa trending. Model ini sedang naik di chart trending Hugging Face minggu ini dengan skor trending tinggi 301 dan 305 suka, didorong oleh minat komunitas terhadap build GGUF dari Unsloth untuk model image-text-to-text 30B.
Siapa yang harus menggunakannya. Pengembang dan hobiis yang ingin menjalankan model multimodal terkuantisasi yang dapat di-deploy secara lokal dan menerima gambar plus teks serta menghasilkan respons teks percakapan.