AI 软件
买软件、装软件之前先查:要不要花钱、能不能填自己的 Key、开源还是收费、用的人多不多。
收录 3,606 款 · 数据来自 GitHub 和 App Store,每天更新 · 更新时间 2026 年 10 月 5 日
用 AI 生成或编辑图片、视频、音乐的工具。
怎么排的:我们整理的常用软件在前,按分类排,同一类里评分人数多的在前;其余按 GitHub 收藏数从多到少。
- Umi OCRhiroi-sora离线OCR文字识别与排版解析,内置PaddleOCR/RapidOCR等机器学习模型实现截图与文档识别工作流。免费开源 · MITGitHub 收藏 47.6K近 7 天 +57
- TTScoqui-ai基于深度学习的文本转语音 (TTS) 与声音克隆工具库及模型训练套件。免费开源 · MPL-2.0GitHub 收藏 46.1K近 7 天 +26
- ChatTTS2noise面向对话场景的生成式语音合成(TTS)模型与推理算法。免费开源 · AGPL-3.0GitHub 收藏 39.9K近 7 天 +13
- Tesseract.jsnaptha基于 Tesseract 封装的纯 JS/WebAssembly OCR 库,能图片多语言文字识别与深度学习 OCR 推理。免费开源 · Apache-2.0GitHub 收藏 38.8K近 7 天 +12
- VoxCPMOpenBMBVoxCPM2 是开源文本转语音(TTS)模型系统。免费开源 · Apache-2.0GitHub 收藏 38.3K近 7 天 +260
- OpenVoicemyshell-aiOpenVoice 是音频基础模型与即时声音克隆项目。免费开源 · MITGitHub 收藏 37.8K近 7 天 +63
- GFPGANTencentARC基于GAN的人脸图像修复与超分辨率算法及模型。许可证需自行查看GitHub 收藏 37.7K近 7 天 +1
- Real-ESRGANxinntao通用图像与视频超分辨率修复算法及PyTorch/NCNN模型推理与训练。免费开源 · BSD-3-ClauseGitHub 收藏 37K近 7 天 +49
- MockingBirdbabysor基于深度学习与PyTorch的中文声音克隆与实时文本转语音合成,包含完整模型训练与推理工作流。许可证需自行查看GitHub 收藏 36.9K近 7 天 +-2
- DragGANXingangPanDragGAN官方开源实现,能基于生成对抗网络(GAN)进行交互式图像拖拽与内容操纵,属于典型的AI图像生成与编辑研究和应用工具。许可证需自行查看GitHub 收藏 35.7K近 7 天 +1
- Diffusershuggingface用于图像、视频和音频生成的前沿扩散模型(Diffusion Models)核心开发与推理训练库。免费开源 · Apache-2.0GitHub 收藏 34.6K近 7 天 +26
- OpenPoseCMU-Perceptual-Computing-Lab基于深度学习/计算机视觉的实时多人人体、面部、手部与足部关键点检测与位姿估计算法库。许可证需自行查看GitHub 收藏 34.5K近 7 天 +13
- CLIPopenaiCLIP是OpenAI开源的多模态图文对比学习神经网络模型。免费开源 · MITGitHub 收藏 34.4K近 7 天 +30
- Awesome GPT Image 2freestylefly核心提供 GPT Image 提示词库、工业级模板、Agent Skill 及在线生图体验。免费开源 · MITGitHub 收藏 33.9K近 7 天 +286
- Fish Speechfishaudio开源文本转语音(TTS)与声音克隆模型架构。许可证需自行查看GitHub 收藏 32.9K近 7 天 +73
- EasyOCRJaidedAIEasyOCR 是基于 PyTorch/CRAFT/CRNN 深度学习的光学字符识别 (OCR) 核心工具库,AI 视觉与模型推理为其首要功能与产品价值。免费开源 · Apache-2.0GitHub 收藏 30K近 7 天 +9
- Open Generative AIAnil-matcha核心产品为开源多模态AI创作工作台,支持图像/视频/音频生成、口型同步以及本地和云端模型推理工作流。免费开源 · MITGitHub 收藏 29.6K近 7 天 +280
- Pixelle-VideoATH-MaaSPixelle-Video核心工作流全自动调用LLM撰写文案、AI生图生视频与TTS合成。免费开源 · Apache-2.0GitHub 收藏 28.6K近 7 天 +151
- Spleeterdeezer基于深度学习/TensorFlow的开源音频音轨分离库与预训练模型。免费开源 · MITGitHub 收藏 28.5K近 7 天 +2
- InvokeAIinvoke-ai核心产品为基于扩散模型的本地/WebUI图像生成与多模态创作工具。免费开源 · Apache-2.0GitHub 收藏 28.3K近 7 天 +33
- UltimatevocalremoverguiAnjok07使用深度神经网络与音源分离AI模型(如MDX-Net、Demucs等)从音频中分离提取人声与伴奏。免费开源 · MITGitHub 收藏 26.5K近 7 天 +70
- WaveFunctionCollapsemxgmn项目实现基于输入样本进行位图/瓦片图生成的纹理合成与约束求解算法(WFC),属于经典的生成式AI/过程化生成算法。许可证需自行查看GitHub 收藏 25.4K近 7 天 +27
- Pytorch CycleGAN And Pix2pixjunyanz经典的 CycleGAN 与 pix2pix 图像生成/转换 PyTorch 实现,核心价值与工作流完全围绕深度学习与计算机视觉图像生成展开。许可证需自行查看GitHub 收藏 25.3K近 7 天 +5
- LLaVAhaotian-liuLLaVA是多模态大语言与视觉模型开源项目,提供端到端多模态模型训练、评测与推理服务代码。免费开源 · Apache-2.0GitHub 收藏 25.1K近 7 天 +12