AI 软件
买软件、装软件之前先查:要不要花钱、能不能填自己的 Key、开源还是收费、用的人多不多。
收录 3,606 款 · 数据来自 GitHub 和 App Store,每天更新 · 更新时间 2026 年 10 月 5 日
用 AI 生成或编辑图片、视频、音乐的工具。
怎么排的:我们整理的常用软件在前,按分类排,同一类里评分人数多的在前;其余按 GitHub 收藏数从多到少。
- InternVLOpenGVLab开源多模态大语言模型(MLLM)及视觉基础模型系列。免费开源 · MITGitHub 收藏 10.2K
- RealtimeSTTKoljaB基于 faster_whisper、sherpa-onnx 等语音识别与 VAD 模型的实时语音转文字库及服务。免费开源 · MITGitHub 收藏 10.2K近 7 天 +10
- U 2 Netxuebinqin显著性目标检测和图像分割的深度学习模型开源实现。免费开源 · Apache-2.0GitHub 收藏 9.9K近 7 天 +2
- Robust Video MattingPeterL1n仓库核心为针对人类视频抠图的循环神经网络深度学习模型 (RVM),提供完整的推理与模型权重。免费开源 · GPL-3.0GitHub 收藏 9.5K近 7 天 +3
- SenseVoiceQwenAudioSenseVoiceSmall 是开源多语言语音基础模型,核心功能涵盖 ASR 语音识别、语种识别、情绪识别及音频事件检测等 AI 工作流。免费开源 · MITGitHub 收藏 9.4K近 7 天 +36
- SANANVlabs基于线性扩散 Transformer 的高效图像与视频生成模型架构与全流程推理训练代码。免费开源 · Apache-2.0GitHub 收藏 9.2K近 7 天 +42
- AutoClipzhouxiaoka基于AI模型对视频字幕进行大纲生成、高光提取与智能切片。免费开源 · MITGitHub 收藏 9.2K近 7 天 +143
- StableStudioStability-AIDreamStudio官方开源前端界面,能生成式图像生成与编辑。免费开源 · MITGitHub 收藏 9K近 7 天 +-3
- Speech recognitionUberi语音识别与转录,封装对接了 Whisper、Google Cloud Speech、Vosk 等多种 AI 语音模型与 API 引擎。免费开源 · BSD-3-ClauseGitHub 收藏 9K近 7 天 +3
- StabilityMatrixLykosAIStable Diffusion等多模态生成模型提供一键包管理、本地模型管理与内置Inference推理工作流。免费开源 · AGPL-3.0GitHub 收藏 8.9K近 7 天 +28
- Stable Dreamfusionashawkey基于NeRF与扩散模型(Stable Diffusion/Zero-1-to-3)实现文本/图像生成3D网格模型,属于AI多模态生成。免费开源 · Apache-2.0GitHub 收藏 8.9K
- Bert VITS2fishaudio项目结合多语言BERT与VITS2骨干网络实现文本转语音(TTS)训练与推理。免费开源 · AGPL-3.0GitHub 收藏 8.8K近 7 天 +-1
- VARFoundationVisionNeurIPS 2024 最佳论文 VAR 的官方实现,能基于多尺度预测的自回归图像生成与训练模型。免费开源 · MITGitHub 收藏 8.7K
- EmotiVoicenetease-youdaoEmotiVoice 是一个开源文本转语音(TTS)引擎,核心实现多音色和情感提示词驱动的语音生成模型与推理工作流。免费开源 · Apache-2.0GitHub 收藏 8.5K近 7 天 +3
- Imagen PytorchlucidrainsGoogle文生图模型Imagen及文生视频扩散模型的PyTorch底层实现与训练工具。免费开源 · MITGitHub 收藏 8.4K近 7 天 +2
- ASRT SpeechRecognitionnl8590687基于深度学习(CNN+CTC与语言模型)的中文语音识别系统,提供完整的模型训练、测试与API部署工作流。免费开源 · GPL-3.0GitHub 收藏 8.4K
- BasicSRXPixelGroupBasicSR 是基于 PyTorch 的开源图像/视频超分辨率与复原工具箱,直接实现和训练 SwinIR、StyleGAN2 等深度学习模型。免费开源 · Apache-2.0GitHub 收藏 8.4K近 7 天 +5
- Qwen-ImageQwenLM开源图像生成与编辑基础模型(Qwen-Image),核心功能完全基于扩散/MMDiT多模态AI模型,支持文生图和图像编辑。免费开源 · Apache-2.0GitHub 收藏 8.4K近 7 天 +3
- Dream Texturescarson-katri项目将Stable Diffusion等生成式AI模型深度集成至Blender中。免费开源 · GPL-3.0GitHub 收藏 8.2K近 7 天 +4
- imaginAIrybrycedrennan核心功能即为通过Stable Diffusion、SVD等AI模型进行图像与视频生成、图像编辑及超分辨率放大。免费开源 · MITGitHub 收藏 8.2K近 7 天 +3
- Background Removernadermx利用 u2net 等视觉 AI 模型实现图像与视频的智能背景抠除。免费开源 · MITGitHub 收藏 8.1K近 7 天 +3
- PaddleGANPaddlePaddle飞桨开源的生成对抗网络(GAN)算法库。免费开源 · Apache-2.0GitHub 收藏 8K
- RapidOCRRapidAIRapidOCR 是基于深度学习与多推理引擎的开源 OCR 文字识别工具包。免费开源 · Apache-2.0GitHub 收藏 8K近 7 天 +51
- ShortGPTRayVentura利用LLM和语音合成自动化生成短视频与配音的多模态视频创作框架。免费开源 · MITGitHub 收藏 8K近 7 天 +13