AI 软件
买软件、装软件之前先查:要不要花钱、能不能填自己的 Key、开源还是收费、用的人多不多。
收录 3,606 款 · 数据来自 GitHub 和 App Store,每天更新 · 更新时间 2026 年 10 月 5 日
检验模型效果、记录和排查 AI 调用的工具。
怎么排的:我们整理的常用软件在前,按分类排,同一类里评分人数多的在前;其余按 GitHub 收藏数从多到少。
- Terminal-Bench-Scienceharbor-frameworkTerminal-Bench-Science 是用于评测 AI Agent 在科学研究工作流中表现的基准测试集与评估框架。免费开源 · Apache-2.0GitHub 收藏 672近 7 天 +30
- RoboDojoRoboDojo-BenchmarkRoboDojo 是通才机器人具身策略模型的虚实评测基准。免费开源 · MITGitHub 收藏 671近 7 天 +22
- Inspect Robotsrobocurve具身智能与物理AI评估框架。免费开源 · MITGitHub 收藏 637近 7 天 +24
- Check CxBingZi-233针对OpenAI、Gemini、Anthropic等AI模型API进行实时可用性探测、首字延迟监控及随机语言挑战真伪校验。免费开源 · MITGitHub 收藏 635近 7 天 +1
- AI Usagebarakitaonrails专门针对各大 AI 模型/编码服务(Claude、OpenRouter、DeepSeek等)配额与用量监控的桌面/终端工具。免费开源 · MITGitHub 收藏 617近 7 天 +35
- SemiaberabuddiesSemia是针对AI Agent技能的安全审计工具。免费开源 · Apache-2.0GitHub 收藏 609
- ParseBenchrun-llamaParseBench 是专为 AI Agent 评估文档解析与 PDF 结构化输出能力的基准测试套件。免费开源 · Apache-2.0GitHub 收藏 594近 7 天 +3
- PostTrainBenchaisa-group评测 CLI Agent 自主进行大语言模型后训练(Post-Training)能力的基准套件。免费开源 · MITGitHub 收藏 581近 7 天 +10
- Claude Dashboarduppinote20专门针对 Claude Code 及多款 AI CLI(Claude、Codex、Gemini、Antigravity、z.ai)的监控与状态栏插件。免费开源 · MITGitHub 收藏 579近 7 天 +2
- Adriansecureagentics面向AI智能体的运行时安全监控工具,通过分析推理轨迹和工具调用拦截越权与注入攻击。免费开源 · Apache-2.0GitHub 收藏 578近 7 天 +1
- Veridropcanarybyte开源的 AI API 中转站/模型真伪与合规检测工具,核心工作流围绕探测 Claude/OpenAI/Gemini 模型输出与加密签名展开。免费开源 · AGPL-3.0GitHub 收藏 577近 7 天 +20
- EnterpriseRAG Benchonyx-dot-app专为企业内部文档 RAG 系统设计的基准测试集与评估工具。免费开源 · MITGitHub 收藏 576近 7 天 +3
- Claude Code Usage MonitorCodeZeno专为 Claude Code、Cursor 等 AI 编程助手与大模型 CLI 监控用量额度和重置时间。免费开源 · MITGitHub 收藏 564近 7 天 +20
- Claude Officepaulrobello实时像素风可视化呈现 Claude Code 和 OpenCode 的多 Agent 操作与会话状态,且集成了 AI 任务摘要与命名生成工作流。免费开源 · MITGitHub 收藏 547近 7 天 +17
- Harness Scorepaladini该项目专门用于评估和量化 AI Coding Agent(如 Cursor、Claude Code 等)的配置、护栏与反馈治理环境(Harness)。免费开源 · MITGitHub 收藏 545近 7 天 +11
- SkillEvaluatorNVIDIA评估 AI Agent Skills 的多层级评测框架。免费开源 · Apache-2.0GitHub 收藏 536近 7 天 +12
- Token Trackerstormzhang面向 Claude Code、Codex 等 AI 编程 Agent 的 Token 消耗与成本追踪工具。免费开源 · MITGitHub 收藏 527近 7 天 +4
- WildClawBenchInternLM面向真实生产环境 AI Agent 的评测基准与测试套件。免费开源 · MITGitHub 收藏 527近 7 天 +2
- Modelsreyamira核心功能即为浏览与对比AI模型、基准评测、编程Agent及供应商服务状态。免费开源 · MITGitHub 收藏 512近 7 天 +2
- TokenEaterAThevon专为 Claude Code 和 OpenAI Codex 编码会话监控 token 消耗及配额限制的 macOS 原生工具。免费开源 · MITGitHub 收藏 510近 7 天 +4
- Pulsequnqin24专为监控 Claude Code、Codex、Cursor 等 70+ AI 编程工具与 API 配额/用量设计的桌面监控工具。免费开源 · Apache-2.0GitHub 收藏 506