AI 软件
买软件、装软件之前先查:要不要花钱、能不能填自己的 Key、开源还是收费、用的人多不多。
收录 3,606 款 · 数据来自 GitHub 和 App Store,每天更新 · 更新时间 2026 年 10 月 5 日
用 AI 生成或编辑图片、视频、音乐的工具。
怎么排的:我们整理的常用软件在前,按分类排,同一类里评分人数多的在前;其余按 GitHub 收藏数从多到少。
- Braglatent-spaces专为Claude Code、Codex等Agent设计的视频生成技能,利用LLM生成脚本并结合Hyperframes合成宣传视频。免费开源 · MITGitHub 收藏 13.4K
- Speech To Speechhuggingface核心功能即为端到端语音 Agent 流水线(VAD->STT->LLM->TTS),全流程由 AI/大模型驱动,完全符合 AI 准入要求。免费开源 · Apache-2.0GitHub 收藏 13.4K近 7 天 +26
- Video Subtitle RemoverYaoFANGUK项目基于深度学习/AI算法模型(如STTN、LAMA、ProPainter、PP-OCRv4等)实现图片与视频硬字幕/水印去除与图像修复。免费开源 · Apache-2.0GitHub 收藏 13.1K近 7 天 +61
- CogVideozai-org开源文本/图像生成视频基础模型(CogVideo与CogVideoX)。免费开源 · Apache-2.0GitHub 收藏 13.1K近 7 天 +9
- Voice Proabus-aikorea音视频创作者提供完整的AI语音克隆、ASR转录与多语言TTS工作流,集成了Whisper、F5-TTS与CosyVoice等模型。免费开源 · GPL-3.0GitHub 收藏 13K近 7 天 +18
- PaddleSpeechPaddlePaddle语音与音频深度学习工具包,涵盖ASR语音识别、TTS语音合成、音频分类与语音翻译等多项AI模型与推理服务。免费开源 · Apache-2.0GitHub 收藏 12.7K近 7 天 +2
- OpenCreatorkrillinai面向创作者的开源多模态 AI 工作区。免费开源 · Apache-2.0GitHub 收藏 12.6K近 7 天 +115
- ViMaxHKUDSViMax是端到端Agent视频生成系统,深度串联大模型、图像与视频生成模型进行剧本策划与视频制作。免费开源 · MITGitHub 收藏 12.5K近 7 天 +26
- Chandradatalab-to核心产品为自研 Chandra 2 复杂文档 OCR 视觉/语言模型,且提供基于 vLLM/Transformers 的完整推理工作流。免费开源 · Apache-2.0GitHub 收藏 12.4K近 7 天 +81
- Ian Xiaohei Illustrationshelloianneo专为 Codex 打造的 AI 配图生成 Skill,通过调用 AI 图像模型为中文文章生成特定视觉风格的手绘插画。免费开源 · MITGitHub 收藏 12.3K近 7 天 +158
- Nerfstudionerfstudio-project神经网络辐射场(NeRF)的模块化开发与训练框架,提供完整的NeRF模型创建、训练与渲染AI工作流。免费开源 · Apache-2.0GitHub 收藏 12K近 7 天 +12
- Speechbrainspeechbrain基于PyTorch的语音与对话AI工具包。免费开源 · Apache-2.0GitHub 收藏 11.9K近 7 天 +10
- Korniakornia基于PyTorch的可微分计算机视觉库,提供几何视觉、数据增强及预训练AI模型(如LoFTR、SAM、RT-DETR等)核心算法工作流。免费开源 · Apache-2.0GitHub 收藏 11.4K近 7 天 +14
- DALLE2 PytorchlucidrainsDALL-E 2 文生图扩散模型的 PyTorch 复现与训练推理实现。免费开源 · MITGitHub 收藏 11.3K近 7 天 +-2
- NarratoAIlinyqh项目基于LLM和视觉大模型实现自动化影视解说、文案撰写、TTS配音及视频剪辑。免费开源 · MITGitHub 收藏 11.3K近 7 天 +53
- LTX-VideoLightricksLTX-Video是Lightricks开源的基于DiT架构的音视频生成基础模型。免费开源 · Apache-2.0GitHub 收藏 11K近 7 天 +24
- Presentonpresenton开源 AI 演示文稿生成器及 API,用户通过大语言模型与图像生成模型完成大纲规划、排版与 PPTX 生成。免费开源 · Apache-2.0GitHub 收藏 11K近 7 天 +136
- YuEmultimodal-art-projection用于全曲音乐生成、符号规划和翻唱编辑的多模态 AI 基础模型及应用框架。免费开源 · Apache-2.0GitHub 收藏 10.8K近 7 天 +321
- Paper2guiBaiyuetribe面向普通用户的 AI 桌面工具箱,封装了语音合成、StableDiffusion、视频超分、人像修复等多项 AI 模型推理与应用工作流。免费开源 · MITGitHub 收藏 10.7K近 7 天 +-2
- Krita AI DiffusionAcly在Krita中集成生成式AI,支持基于Diffusion、ControlNet等模型的绘图、实时生成与图像编辑工作流。免费开源 · GPL-3.0GitHub 收藏 10.7K近 7 天 +21
- Manga Image Translatorzyddnys漫画/图像文本翻译与修复。免费开源 · GPL-3.0GitHub 收藏 10.5K近 7 天 +24
- Amphionopen-mmlab专门针对音频、语音和音乐生成的开源工具包与模型研发框架,核心实现涵盖TTS、VC、SVC、TTA等多项深度学习模型训练与推理工作流。免费开源 · MITGitHub 收藏 10.3K近 7 天 +-3
- LaMaadvimman基于傅里叶卷积的图像大掩码修复算法与模型训练推理实现。免费开源 · Apache-2.0GitHub 收藏 10.3K近 7 天 +9
- TTSmozilla基于深度学习的文本转语音(TTS)模型训练、微调与推理库。免费开源 · MPL-2.0GitHub 收藏 10.2K近 7 天 +1