AI 软件
买软件、装软件之前先查:要不要花钱、能不能填自己的 Key、开源还是收费、用的人多不多。
收录 3,606 款 · 数据来自 GitHub 和 App Store,每天更新 · 更新时间 2026 年 10 月 5 日
用 AI 生成或编辑图片、视频、音乐的工具。
怎么排的:我们整理的常用软件在前,按分类排,同一类里评分人数多的在前;其余按 GitHub 收藏数从多到少。
- Moonshinemoonshine-ai低延迟端侧语音识别(STT)、意图识别与语音合成(TTS),用于构建实时语音AI Agent与交互界面。许可证需自行查看GitHub 收藏 11.2K近 7 天 +34
- LTX-VideoLightricksLTX-Video是Lightricks开源的基于DiT架构的音视频生成基础模型。免费开源 · Apache-2.0GitHub 收藏 11K近 7 天 +24
- Fast Style Transferlengstrom基于TensorFlow实现快速图像和视频神经风格迁移CNN模型训练与推理。代码公开,未声明开源许可证GitHub 收藏 11K近 7 天 +-3
- Presentonpresenton开源 AI 演示文稿生成器及 API,用户通过大语言模型与图像生成模型完成大纲规划、排版与 PPTX 生成。免费开源 · Apache-2.0GitHub 收藏 11K近 7 天 +136
- YuEmultimodal-art-projection用于全曲音乐生成、符号规划和翻唱编辑的多模态 AI 基础模型及应用框架。免费开源 · Apache-2.0GitHub 收藏 10.8K近 7 天 +321
- Paper2guiBaiyuetribe面向普通用户的 AI 桌面工具箱,封装了语音合成、StableDiffusion、视频超分、人像修复等多项 AI 模型推理与应用工作流。免费开源 · MITGitHub 收藏 10.7K近 7 天 +-2
- Krita AI DiffusionAcly在Krita中集成生成式AI,支持基于Diffusion、ControlNet等模型的绘图、实时生成与图像编辑工作流。免费开源 · GPL-3.0GitHub 收藏 10.7K近 7 天 +21
- Pix2pixphillipi基于条件对抗网络(cGAN)的图像到图像翻译模型训练与测试实现,属于直接的图像生成AI研究与算法实现。许可证需自行查看GitHub 收藏 10.7K近 7 天 +-3
- Manga Image Translatorzyddnys漫画/图像文本翻译与修复。免费开源 · GPL-3.0GitHub 收藏 10.5K近 7 天 +24
- Amphionopen-mmlab专门针对音频、语音和音乐生成的开源工具包与模型研发框架,核心实现涵盖TTS、VC、SVC、TTA等多项深度学习模型训练与推理工作流。免费开源 · MITGitHub 收藏 10.3K近 7 天 +-3
- LaMaadvimman基于傅里叶卷积的图像大掩码修复算法与模型训练推理实现。免费开源 · Apache-2.0GitHub 收藏 10.3K近 7 天 +9
- TTSmozilla基于深度学习的文本转语音(TTS)模型训练、微调与推理库。免费开源 · MPL-2.0GitHub 收藏 10.2K近 7 天 +1
- InternVLOpenGVLab开源多模态大语言模型(MLLM)及视觉基础模型系列。免费开源 · MITGitHub 收藏 10.2K
- RealtimeSTTKoljaB基于 faster_whisper、sherpa-onnx 等语音识别与 VAD 模型的实时语音转文字库及服务。免费开源 · MITGitHub 收藏 10.2K近 7 天 +10
- U 2 Netxuebinqin显著性目标检测和图像分割的深度学习模型开源实现。免费开源 · Apache-2.0GitHub 收藏 9.9K近 7 天 +2
- LTX-2LightricksLTX-2 官方音视频生成基础模型的推理与 LoRA 训练代码库。许可证需自行查看GitHub 收藏 9.6K近 7 天 +45
- Robust Video MattingPeterL1n仓库核心为针对人类视频抠图的循环神经网络深度学习模型 (RVM),提供完整的推理与模型权重。免费开源 · GPL-3.0GitHub 收藏 9.5K近 7 天 +3
- Video ShotcraftVincentwei1021Claude Code/Codex 定制的 AI agent skill,提供分镜卡片与工作流。代码公开,未声明开源许可证GitHub 收藏 9.5K近 7 天 +-295
- SenseVoiceQwenAudioSenseVoiceSmall 是开源多语言语音基础模型,核心功能涵盖 ASR 语音识别、语种识别、情绪识别及音频事件检测等 AI 工作流。免费开源 · MITGitHub 收藏 9.4K近 7 天 +36
- So Vits Svc Forkvoicepaw基于深度学习的歌声转换工具,提供基于 VITS/HuBERT/CREPE 的本地/实时音频推理与模型训练完整 AI 工作流。许可证需自行查看GitHub 收藏 9.3K近 7 天 +6
- SANANVlabs基于线性扩散 Transformer 的高效图像与视频生成模型架构与全流程推理训练代码。免费开源 · Apache-2.0GitHub 收藏 9.2K近 7 天 +42
- AutoClipzhouxiaoka基于AI模型对视频字幕进行大纲生成、高光提取与智能切片。免费开源 · MITGitHub 收藏 9.2K近 7 天 +143
- StableStudioStability-AIDreamStudio官方开源前端界面,能生成式图像生成与编辑。免费开源 · MITGitHub 收藏 9K近 7 天 +-3
- Speech recognitionUberi语音识别与转录,封装对接了 Whisper、Google Cloud Speech、Vosk 等多种 AI 语音模型与 API 引擎。免费开源 · BSD-3-ClauseGitHub 收藏 9K近 7 天 +3