
GitHub 收藏3.3K
代码最近更新2026 年 8 月 20 日
许可证开源 · MIT
要不要花钱免费
它通过大模型对 AI 的执行轨迹进行细粒度打分,支持多方案选优、两两对比和每步进展跟踪。适合 AI 开发者和评测研究人员。需要写代码调用或通过命令行运行,并配置大模型接口密钥。
用起来难吗要写代码在哪用命令行
能用的模型
能做什么
- 选出多个方案里的最佳执行结果
- 对比评估两个执行轨迹的好坏
- 跟踪并打分每一步的完成进度
- 统计评测调用的 Token 消耗
怎么开始
- 需具备代码能力,克隆项目后安装依赖库
- 配置大模型接口密钥或本地兼容服务的地址
- 在代码中调用对比、选优或运行评测脚本
选它,如果你……
- 你需要从多个 AI 运行轨迹中选出最正确的结果
- 你需要对 AI 解决问题的每一步骤进行打分与监控
- 你希望不用额外训练就用大模型做严格的评测反馈
别选,如果你……
- 你不会写代码且需要带界面的现成软件
- 你只是想找一个直接聊天的日常 AI 工具
怎么用
代码开源,可以免费下载使用。
多少钱、在哪买
免费使用。
综合评价:一般(更新放缓或问题处理差)
| 更新 | 放缓 | 近 90 天改代码 13 次;没有正式发版记录 |
|---|---|---|
| 问题处理 | 差 | 近 90 天新开 11 个问题,解决了 3 个;外部提交的修改合进 3 个,待处理 16 个 |
| 用的人 | 一般 | GitHub 收藏 3,296;3 人参与开发 |
| 用户口碑 | 暂不计 | 用户评价满 5 条后才算进来 |
数字取自 GitHub 的公开记录(2026/10/6), 用户评价来自本页口碑。自己核对:项目主页、问题、外部提交的修改、发版记录。
怎么评的
只看公开、能核对的数据,不打分数,只给四档结论,每一项的依据都写在旁边。
- 更新:近 90 天改了多少次代码、最近一次发版是哪天。7 天内有改动并且改得多或常发版,算「很活跃」;30 天内有改动算「活跃」;半年内算「放缓」;半年以上没动或者已经归档,算「停更」。
- 问题处理:近 90 天新开的问题解决了几成、一般几天解决、外部提交的修改积压了多少。解决八成以上、一般一周内解决、积压不比合进去的多,算「好」;解决不到一半算「差」;其余算「一般」。新问题不到 10 个的不评。
- 用的人:GitHub 收藏 5 万以上算很多,1 万以上算多,1 千以上算一般。旁边写近 7 天新增多少、多少人参与开发。
- 用户口碑:用户评价满 5 条才算进来(注册不满 7 天的账号不算);平均分在 2.5 分及以下,总评降一档。
- 总评四档:还在更新、问题处理好、用的人多 → 推荐;还在更新 → 不错;更新放缓或问题处理差 → 一般;半年以上没更新 → 谨慎。许可证有附加条件、商用受限的,单独提醒,不影响总评。
- 收费软件(ChatGPT、Cursor 这类)没有公开的问题记录,就看 App Store:最近一次更新在 30 天内算「活跃」,半年内算「放缓」,半年以上算「停更」;打分人数 10 万以上算很多,1 万以上算多,1 千以上算一般;评分 4 分以上算好,2.5 分及以下算差,打分不到 100 人不评。再加上用户评价。
收藏数能刷,所以只占一项;更新和问题处理很难刷。数据每天更新,超过两周没更新的不评。
能替代它的
iFixAi综合评价:不错以命令行方式对自主 AI 进行独立审计与打分
RagaAI Catalyst综合评价:谨慎侧重全流程监测、评估与调试,功能更偏平台化
Phoenix综合评价:不错侧重运行轨迹追踪与监控,并集成提示词管理
| 软件 | 起步价 | 难不难用 | 中文 | 开源 | 口碑 | 最近更新 |
|---|---|---|---|---|---|---|
| LLM-as-a-Verifier | 免费 | 要写代码 | 没写明 | 开源 | 还没人评 | 47 天前 |
| iFixAi | 免费 | 要填自己的模型 Key | 有中文界面 | 开源 | 还没人评 | 20 天前 |
| RagaAI Catalyst | 免费 | 要写代码 | 没写明 | 开源 | 还没人评 | 470 天前 |
| Phoenix | — | 要写代码 | 没写明 | 代码公开 | 还没人评 | 4 天前 |
最近更新和热度
近 30 天 GitHub 收藏:+0
看看它的样子
用户口碑
用户评价
还没有评价写下你的看法,帮大家了解这款软件。
用户提问
还没有提问有疑问就写下来,和大家一起聊聊。
数据来源:GitHub,每天更新,更新时间 2026 年 10 月 6 日。 信息有误?告诉我们。