Awesome-LLM-Eval综合评价:谨慎

onejune2018 · 学习资料

整理大模型评测工具、基准数据集与论文的学习资源清单。

免费开源 · MIT
GitHub 收藏659
代码最近更新2025 年 11 月 24 日
许可证开源 · MIT
要不要花钱免费

汇集大模型评测相关的工具、测试基准、排行榜与论文资料。适合大模型研究员和技术开发者查阅参考。在浏览器打开网页即可阅读清单和获取资源。

用起来难吗打开网页就能用在哪用网页

能做什么

  • 整理大模型评测工具与框架
  • 汇总各领域基准测试数据集
  • 提供评测排行榜与论文链接
  • 按智商与通用能力等分类整理

怎么开始

  1. 在浏览器中打开项目的 GitHub 页面
  2. 根据目录导航查找所需的评测数据集或工具
  3. 点击表格或列表里的链接获取详细资料

选它,如果你……

  • 你需要寻找评测大模型能力的测试基准与数据集
  • 你想调研市面上现有的大模型评测工具与排行榜
  • 你在撰写大模型评测相关的学术论文或技术报告

别选,如果你……

  • 你想要拿来即用的现成评测软件而非资料汇总
  • 你只是想直接找个 AI 聊天而不需要做技术评测

怎么用

代码开源,可以免费下载使用。

多少钱、在哪买

免费使用。

综合评价:谨慎(半年以上没更新)

更新停更最近一次改代码是 318 天前;没有正式发版记录
问题处理暂不评近 90 天只有 3 个新问题,太少不评
用的人少GitHub 收藏 659;4 人参与开发
用户口碑暂不计用户评价满 5 条后才算进来

数字取自 GitHub 的公开记录(2026/10/8), 用户评价来自本页口碑。自己核对:项目主页、问题、外部提交的修改、发版记录。

怎么评的

只看公开、能核对的数据,不打分数,只给四档结论,每一项的依据都写在旁边。

  • 更新:近 90 天改了多少次代码、最近一次发版是哪天。7 天内有改动并且改得多或常发版,算「很活跃」;30 天内有改动算「活跃」;半年内算「放缓」;半年以上没动或者已经归档,算「停更」。
  • 问题处理:近 90 天新开的问题解决了几成、一般几天解决、外部提交的修改积压了多少。解决八成以上、一般一周内解决、积压不比合进去的多,算「好」;解决不到一半算「差」;其余算「一般」。新问题不到 10 个的不评。
  • 用的人:GitHub 收藏 5 万以上算很多,1 万以上算多,1 千以上算一般。旁边写近 7 天新增多少、多少人参与开发。
  • 用户口碑:用户评价满 5 条才算进来(注册不满 7 天的账号不算);平均分在 2.5 分及以下,总评降一档。
  • 总评四档:还在更新、问题处理好、用的人多 → 推荐;还在更新 → 不错;更新放缓或问题处理差 → 一般;半年以上没更新 → 谨慎。许可证有附加条件、商用受限的,单独提醒,不影响总评。
  • 收费软件(ChatGPT、Cursor 这类)没有公开的问题记录,就看 App Store:最近一次更新在 30 天内算「活跃」,半年内算「放缓」,半年以上算「停更」;打分人数 10 万以上算很多,1 万以上算多,1 千以上算一般;评分 4 分以上算好,2.5 分及以下算差,打分不到 100 人不评。再加上用户评价。

收藏数能刷,所以只占一项;更新和问题处理很难刷。数据每天更新,超过两周没更新的不评。

最近更新和热度

近 30 天 GitHub 收藏:+1

用户口碑

发布软件评论

评分
选填

数据来源:GitHub,每天更新,更新时间 2026 年 10 月 8 日。 信息有误?告诉我们。

Awesome-LLM-Eval:是什么、要不要花钱、怎么用 | 模真真