AI 软件
买软件、装软件之前先查:要不要花钱、能不能填自己的 Key、开源还是收费、用的人多不多。
收录 3,606 款 · 数据来自 GitHub 和 App Store,每天更新 · 更新时间 2026 年 10 月 5 日
用 AI 生成或编辑图片、视频、音乐的工具。
怎么排的:我们整理的常用软件在前,按分类排,同一类里评分人数多的在前;其余按 GitHub 收藏数从多到少。
- Mlx AudioBlaizzy基于Apple MLX框架的多模态音频AI库,提供TTS、STT、STS等多种模型推理与量化。免费开源 · MITGitHub 收藏 8K近 7 天 +32
- InfiniteTalkMeiGen-AI基于扩散模型与音频编码器的无限时长说话人视频生成与配音(I2V/V2V)。免费开源 · Apache-2.0GitHub 收藏 8K近 7 天 +40
- MochiDiffusionMochiDiffusion基于Core ML和Metal在Mac本地运行Stable Diffusion与FLUX.2模型生成图像的原生AI应用。免费开源 · GPL-3.0GitHub 收藏 8K近 7 天 +2
- Fast Stable DiffusionTheLastBenStable Diffusion、ComfyUI、A1111 与 DreamBooth 的 Colab 快速微调与运行笔记本。免费开源 · MITGitHub 收藏 7.9K
- VITSjaywalnut310端到端文本转语音(TTS)的深度学习生成模型与训练推理实现。免费开源 · MITGitHub 收藏 7.9K近 7 天 +-1
- ComfyUI Workflows ZHOZHO-ZHO-ZHOComfyUI 工作流合集,核心内容及实现均为基于 FLUX、SD3、Hunyuan Video、LLM、3D 生成等 AI 多模态模型的实际生成工作流配置与实践。免费开源 · GPL-3.0GitHub 收藏 7.9K近 7 天 +10
- Dreambooth Stable DiffusionXavierXiao基于Stable Diffusion实现Dreambooth微调扩散模型与个性化图像生成工作流,属于AI多模态生成微调实现。免费开源 · MITGitHub 收藏 7.7K近 7 天 +-4
- MeloTTSmyshell-ai多语言文本转语音(TTS)模型库,能语音合成推理与训练。免费开源 · MITGitHub 收藏 7.7K近 7 天 +2
- GLM-OCRzai-orgGLM-OCR 是专门面向复杂文档理解的多模态 OCR 模型及推理 SDK。免费开源 · Apache-2.0GitHub 收藏 7.5K近 7 天 +11
- MMagicopen-mmlabMMagic 是专注于图像/视频生成、编辑与修复的多模态 AIGC 工具箱。免费开源 · Apache-2.0GitHub 收藏 7.5K近 7 天 +2
- SD.Nextvladmandic核心产品为用于AI图像/视频生成与处理的全功能WebUI,直接运行扩散模型与多模态模型。免费开源 · Apache-2.0GitHub 收藏 7.4K近 7 天 +9
- Final2xEutropicAI跨平台图像超分辨率工具,核心功能依赖 PyTorch 与计算机视觉超分辨率模型处理图像。免费开源 · BSD-3-ClauseGitHub 收藏 7.3K近 7 天 +-3
- Auto Photoshop StableDiffusion PluginAbdullahAlfaraj在Photoshop中直接调用Stable Diffusion/ComfyUI实现文生图、图生图、扩图等AI图像生成工作流。免费开源 · MITGitHub 收藏 7.3K近 7 天 +2
- Infinite Canvasbasketikun核心产品为面向 AI 创作的开源无限画布工作台,深度集成生图、视频生成、Agent 助手与模型 API 接入工作流。免费开源 · MITGitHub 收藏 7.3K近 7 天 +167
- Civitaicivitai核心产品为 Stable Diffusion 等 AI 生态模型与定制化资产分享、训练与协作平台。免费开源 · Apache-2.0GitHub 收藏 7.3K近 7 天 +12
- ZonosZyphraZonos-v0.1 是开源多语种文本转语音(TTS)与声音克隆深度学习模型。免费开源 · Apache-2.0GitHub 收藏 7.2K
- BackgroundMattingV2PeterL1n仓库核心为高质量实时视频/图像抠图神经网络模型及推理训练开源代码。免费开源 · MITGitHub 收藏 7.2K
- DCGAN Tensorflowcarpedm20DCGAN深度卷积生成对抗网络的Tensorflow开源实现,核心功能即为深度学习生成模型的训练与图像生成。免费开源 · MITGitHub 收藏 7.2K近 7 天 +1
- InfographicantvisAI友好的声明式信息图生成与流式渲染引擎,深度集成Agent Skills及LLM生成工作流。免费开源 · MITGitHub 收藏 6.9K近 7 天 +60
- JellyfishForget-C面向AI短剧制作的全流程工作台,直接集成剧本理解分镜、多模型管理及图像视频生成任务。免费开源 · Apache-2.0GitHub 收藏 6.6K近 7 天 +105
- Podcastfysouzatharsis核心功能即利用GenAI多模态大模型及TTS生成多语言播客对话音频,AI为产品主干业务。免费开源 · Apache-2.0GitHub 收藏 6.6K近 7 天 +9
- StyleTTS 2yl4579基于扩散模型与语音大模型的文本转语音(TTS)模型训练与推理系统。免费开源 · MITGitHub 收藏 6.4K近 7 天 +3
- FunClipmodelscopeFunClip 是基于 FunASR 语音识别、说话人分离与 LLM/多模态模型的自动化视频剪辑工具。免费开源 · MITGitHub 收藏 6.4K近 7 天 +10
- Orpheus TTScanopyai基于Llama-3b骨干构建的开源文本转语音(TTS)模型系统,包含预训练、微调与实时流式推理AI工作流。免费开源 · Apache-2.0GitHub 收藏 6.3K