1. MiniMax-H3 by MiniMaxAI
image-text-to-video · diffusers · Likes: 3574 · Downloads: 59368 · View on Hugging Face →
Tags: diffusers, safetensors, text-to-video, image-to-video, image-text-to-video, video-to-video, text-to-audio-video
是什么。 MiniMax-H3 是 diffusers 库中的一个多模态模型,其主要 pipeline 为 image-text-to-video,标签还覆盖了由文本、图像、视频、音频及参考输入生成同步音视频的能力。
为何走红。 本周其趋势得分为 1346,社区参与度表现强劲,获得 3,574 次点赞及超过 59,000 次下载。
适用对象。 适用于构建多模态生成 pipeline 的开发者与研究者,需要从文本、图像、视频、音频或参考输入的组合生成同步音视频输出的场景。
2. Muse-Glimmer-30B by meta-models
image-text-to-text · transformers · Likes: 1097 · Downloads: 0 · View on Hugging Face →
Tags: transformers, safetensors, muse_glimmer, image-text-to-text, conversational, arxiv:2504.13181, arxiv:2602.06036
是什么。 Muse-Glimmer-30B 是 meta-models 推出的 300 亿参数多模态模型,专为 image-text-to-text 生成与对话任务设计。
为何走红。 本周因其强劲的社区关注度而走红,证据包括超过 1,000 次点赞与较高的趋势得分,同时搭配开放的 Apache 2.0 许可证以及与 image-text-to-text 任务相关的研究论文。
适用对象。 面向处理图像与文本组合输入的多模态对话类应用的开发者与研究者是该模型的目标用户。
3. DeepSeek-V4-Flash-0731 by deepseek-ai
text-generation · transformers · Likes: 3150 · Downloads: 1048685 · View on Hugging Face →
Tags: transformers, safetensors, deepseek_v4, text-generation, conversational, arxiv:2606.19348, license:mit
是什么。 DeepSeek-V4-Flash-0731 是基于 transformers 库构建的对话模态 text-generation 模型,提供 fp8 与 8-bit 量化格式。
为何走红。 该模型已突破 100 万次下载,并获得 3,150 次点赞,趋势得分达 668,表明本周社区采用速度迅猛、热度高涨。
适用对象。 寻求可用于部署的量化 text-generation 模型以驱动对话类应用(尤其在 Azure 端点上)的开发者与团队应考虑该模型。
4. MiniMax-H3-Turbo-Lora by larryvrh
text-to-video · Likes: 651 · Downloads: 0 · View on Hugging Face →
Tags: text-to-video, text-to-audio, audio-video, lora, minimax-h3, comfyui, base_model:Comfy-Org/MiniMax-H3
是什么。 该模型是 MiniMax-H3 的 LoRA 适配器,可通过 ComfyUI 执行 text-to-video 生成,并具备音视频(audio-video)相关能力。
为何走红。 该项目本周表现突出,社区参与度强劲,获得 651 次点赞,趋势得分高达 612,尽管下载量为零。
适用对象。 面向在 ComfyUI 环境中工作的创作者与开发者,希望使用基于 MiniMax-H3 的 LoRA 来完成 text-to-video 与 text-to-audio 工作流。
5. MiniMax-H3 by Comfy-Org
Model · diffusion-single-file · Likes: 1212 · Downloads: 6798796 · View on Hugging Face →
Tags: diffusion-single-file, comfyui, base_model:MiniMaxAI/MiniMax-H3, base_model:finetune:MiniMaxAI/MiniMax-H3
是什么。 MiniMax-H3 是由 Comfy-Org 开发的单文件 diffusion 模型,配合 ComfyUI 界面使用,可执行图像生成任务。
为何走红。 该模型目前在 Hugging Face 趋势榜上得分为 535,下载量超过 670 万,社区点赞超过 1,200 次,反映出近期强劲的用户采用热度。
适用对象。 适合希望通过低门槛、开箱即用的扩散模型运行图像生成工作流、无需复杂配置的 ComfyUI 用户。
6. Kimi-K3 by moonshotai
image-text-to-text · transformers · Likes: 10526 · Downloads: 1565484 · View on Hugging Face →
Tags: transformers, safetensors, kimi_k3, feature-extraction, compressed-tensors, conversational, image-text-to-text
是什么。 Kimi-K3 是 moonshotai 开发的多模态 image-text-to-text 模型,可同时接受图像与文本输入并生成文本输出。
为何走红。 本周走红源于其在 Hugging Face 上高度的用户参与度:下载量超过 156 万、点赞数超过 10,500、趋势得分为 385。
适用对象。 适用于构建融合图像与文本输入的多模态文本生成应用的开发者,涵盖对话及视觉内容分析等用例。
7. LFM2.5-2.6B by LiquidAI
text-generation · transformers · Likes: 550 · Downloads: 93668 · View on Hugging Face →
Tags: transformers, safetensors, lfm2, text-generation, liquid, lfm2.5, edge, conversational, ar, zh, en, fr, de, hi, id
是什么。 LFM2.5-2.6B 是 LiquidAI 推出的 2.6B 参数 text-generation 模型,由 LFM2.5-2.6B-Base 微调而来,适用于多种语言的对话场景。
为何走红。 本周凭借 373 的较高趋势得分、550 次点赞以及超过 93,000 次下载获得关注,反映出对其面向边缘场景、多语言设计的浓厚兴趣。
适用对象。 面向构建多语言对话式 AI 应用的开发者与研究者,尤其针对边缘部署场景的项目。
8. Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF by DavidAU
image-text-to-text · Likes: 1898 · Downloads: 2521093 · View on Hugging Face →
Tags: gguf, unsloth, fine tune, heretic, uncensored, abliterated, ara, MTP GGUF Quants, Regular GGUF Quants, qwen3.6
是什么。 一款基于 Qwen3.6 的 GGUF 量化、270 亿参数微调语言模型,针对 image-text-to-text 对话、推理、创意写作及编程任务进行了配置。
为何走红。 该项目累计下载量超过 250 万、点赞数接近 1,900,并伴随较高的趋势得分,反映出社区对 Qwen3.6 基座上多阶段、无审查微调版本的强烈兴趣。
适用对象。 适合寻求无限制、多语言对话模型(兼具推理与图文理解能力)的创意写作者、角色扮演者与开发者。
9. Minimax-h3-Turbo by lightx2v
image-to-video · diffusers · Likes: 341 · Downloads: 20376 · View on Hugging Face →
Tags: diffusers, t2v, i2v, r2v, image-to-video, en, zh, base_model:MiniMaxAI/MiniMax-H3
是什么。 Minimax-h3-Turbo 是基于 Diffusers 构建、标注为 image-to-video 生成(同时附带 text-to-video 与 reference-to-video 标签)的模型,是 MiniMax-H3 基座模型的微调版本。
为何走红。 该模型本周关注度持续上升,趋势得分为 327,支撑数据包括 341 次点赞以及在 Hugging Face Hub 上超过 20,000 次的下载量。
适用对象。 面向使用 Diffusers 库、需要源自 MiniMax-H3 基座的图像条件视频生成模型的开发者与研究者。
10. Muse-Glimmer-30B-GGUF by unsloth
image-text-to-text · transformers · Likes: 305 · Downloads: 0 · View on Hugging Face →
Tags: transformers, gguf, unsloth, meta, image-text-to-text, arxiv:2504.13181, arxiv:2602.06036
是什么。 一款 GGUF 量化的 300 亿参数视觉语言模型,可执行图文到文本生成,基于 Meta 的 Muse-Glimmer-30B 基座模型,由 Unsloth 以 Apache-2.0 许可证发布。
为何走红。 该模型本周在 Hugging Face 趋势榜上持续攀升,趋势得分高达 301,点赞数 305,背后驱动力来自社区对 Unsloth 所构建的 300 亿参数 GGUF 版 image-text-to-text 模型的兴趣。
适用对象。 适合希望运行量化、可在本地部署的多模态模型(接受图像与文本输入并产出对话式文本响应)的开发者与爱好者。