AI 软件
买软件、装软件之前先查:要不要花钱、能不能填自己的 Key、开源还是收费、用的人多不多。
收录 3,606 款 · 数据来自 GitHub 和 App Store,每天更新 · 更新时间 2026 年 10 月 5 日
用 AI 生成或编辑图片、视频、音乐的工具。
怎么排的:我们整理的常用软件在前,按分类排,同一类里评分人数多的在前;其余按 GitHub 收藏数从多到少。
- Silero Modelssnakers4核心为预训练文本转语音(TTS)与语音模型套件,用户直接调用模型进行语音合成推理。许可证需自行查看GitHub 收藏 6.1K近 7 天 +3
- LatentSyncbytedance基于音频驱动的Latent Diffusion模型实现唇形同步,提供了完整的数据处理、U-Net训练与推理流水线。免费开源 · Apache-2.0GitHub 收藏 6.1K近 7 天 +6
- Abogendenizsafak基于 Kokoro-82M 模型和 LLM 文本规范化将文本、电子书与字幕转换为语音与同步字幕。免费开源 · MITGitHub 收藏 6.1K近 7 天 +16
- OpenpencilZSeven-W开源AI原生矢量设计工具,核心功能包含Prompt转UI、多Agent协作设计与MCP设计自动化。免费开源 · MITGitHub 收藏 6.1K近 7 天 +45
- Chinese CLIPOFA-Sys中文跨模态CLIP预训练模型、图文特征提取、跨模态检索及零样本图像分类。免费开源 · MITGitHub 收藏 6K
- Ip As Logo Skills1dashu专用于AI Agent的多模态生图Skill,指导AI模型生成吉祥物与Logo图像。免费开源 · MITGitHub 收藏 5.8K近 7 天 +163
- Remove AI Watermarkswiltodelta通过扩散模型重生成、MI-GAN/LaMa修复等AI/CV技术去除图像和视频中的AI水印与元数据。免费开源 · Apache-2.0GitHub 收藏 5.8K近 7 天 +63
- Piper1 GplOHF-VoicePiper 是快速且本地运行的神经文本转语音(neural TTS)引擎,核心价值与工作流直接基于语音模型推理与模型训练。免费开源 · GPL-3.0GitHub 收藏 5.8K近 7 天 +55
- SUPIRFanghua-Yu基于SDXL和LLaVA的多模态图像超分辨率与修复模型及推理代码。许可证需自行查看GitHub 收藏 5.7K近 7 天 +6
- Basic Pitchspotify基于轻量级神经网络的自动音乐转录(AMT),直接运行音频到MIDI的机器学习模型推理。免费开源 · Apache-2.0GitHub 收藏 5.7K近 7 天 +24
- Whisper DiarizationMahmoudAshraf97项目结合 OpenAI Whisper、MarbleNet、TitaNet 等模型实现语音识别与说话人日志切分。免费开源 · BSD-2-ClauseGitHub 收藏 5.7K近 7 天 +2
- GPT Image2 Skillwuyoscar该项目专注于 GPT Image 2/2.5 的 Prompt 画廊、Agent Skills 与 CLI 图像生成和编辑工具。免费开源 · MITGitHub 收藏 5.6K近 7 天 +47
- Gemini Watermark RemoverGargantuaX针对 Gemini AI 生成的图像与视频进行无损去水印后处理,并提供 Agent Skill 与网页/浏览器扩展工具。免费开源 · MITGitHub 收藏 5.6K
- DALLE Pytorchlucidrains仓库实现了 OpenAI DALL-E 文本生成图像 Transformer 模型及训练与推理流程。免费开源 · MITGitHub 收藏 5.6K近 7 天 +-1
- Red InkHisMax基于大语言模型与图像生成模型的小红书图文内容一键生成应用。许可证需自行查看GitHub 收藏 5.6K近 7 天 +16
- SwinIRJingyunLiang基于Swin Transformer实现的图像超分辨率、去噪与压缩伪影去除的经典计算机视觉AI模型实现与评估工具。免费开源 · Apache-2.0GitHub 收藏 5.6K近 7 天 +2
- ECCV2022 RIFEhzwer核心为基于深度学习的实时视频插帧算法(RIFE)开源实现,涵盖模型推理与训练全流程。免费开源 · MITGitHub 收藏 5.6K近 7 天 +7
- YouDub Webuiliuzhao1225开源AI视频翻译配音工具,核心流程深度结合Whisper语音识别、LLM文本翻译及VoxCPM2/TTS语音生成合成。免费开源 · Apache-2.0GitHub 收藏 5.6K近 7 天 +40
- Learning to See in the Darkcchen156CVPR 2018 论文官方代码,能基于深度学习/Tensorflow的暗光图像增强与模型训练推理,属于计算机视觉AI研究。免费开源 · MITGitHub 收藏 5.6K
- ComfyUI-CopilotATH-MaaSComfyUI-Copilot是用于ComfyUI工作流的AI智能助手,利用LLM/Agent实现工作流自动生成、错误Debug、重写与节点推荐等核心功能。免费开源 · MITGitHub 收藏 5.5K近 7 天 +9
- Lottiediffusionstudio通过 Claude Code、Codex 或支持 skills 的 Coding Agent 提示词生成生产级 Lottie 动画,属于 AI 多模态生成与 Agent 技能框架。免费开源 · MITGitHub 收藏 5.5K近 7 天 +15
- Short Video FactoryYILS-LIN短视频工厂核心业务工作流深度依赖AI文案生成(兼容OpenAI接口)及语音合成自动化剪辑视频。免费开源 · AGPL-3.0GitHub 收藏 5.5K近 7 天 +28
- SmartSubbuxuku核心产品为音视频字幕生成、翻译与配音工具,深度集成 Whisper/FunASR 本地模型、LLM 智能副驾与 MCP 自动化工作流。免费开源 · MITGitHub 收藏 5.5K近 7 天 +113
- Edit BananaBIT-DataLab核心工作流基于 SAM3 图像分割与多模态大模型/OCR 实现静态图表到可编辑 DrawIO XML 的重建与转换。免费开源 · AGPL-3.0GitHub 收藏 5.5K近 7 天 +-5