VLMEvalKit综合评价:一般

open-compass · 评测与监控

多模态大模型评测工具,一条命令评测图文与视频能力。

免费开源 · Apache-2.0
GitHub 收藏4.4K
代码最近更新2026 年 9 月 30 日
许可证开源 · Apache-2.0
要不要花钱免费

主要用来跑各类多模态大模型在图像和视频基准上的测试,支持精确匹配与大模型辅助评分。适合算法工程师和研究人员用。需要写代码并在命令行中运行评测。

用起来难吗要写代码在哪用命令行

能做什么

  • 一键运行多模态评测
  • 评测图像与视频理解
  • 提取答案并自动打分
  • 支持多机分布式推理

怎么开始

  1. 需具备代码基础,在本地安装 Python 运行包
  2. 根据要评测的模型配置环境与接口变量
  3. 在命令行输入评测命令并查看生成的测试结果

选它,如果你……

  • 你需要横向评测多种视觉与视频大模型的能力
  • 你希望一条命令自动在多个评测集上跑分
  • 你想直接查看排行榜数据或做自定义模型测试

别选,如果你……

  • 你不会写代码且不想在命令行里配置运行环境
  • 你只想在网页或图形界面里直接点开聊天

怎么用

代码开源,可以免费下载使用。

多少钱、在哪买

免费使用。

综合评价:一般(更新放缓或问题处理差)

更新活跃近 90 天改代码 52 次;最近一次发版是 562 天前(v0.2)
问题处理差近 90 天新开 24 个问题,解决了 10 个,一般 10.6 天解决;外部提交的修改合进 52 个,待处理 78 个
用的人一般GitHub 收藏 4,429;289 人参与开发
用户口碑暂不计用户评价满 5 条后才算进来

数字取自 GitHub 的公开记录(2026/10/6), 用户评价来自本页口碑。自己核对:项目主页、问题、外部提交的修改、发版记录。

怎么评的

只看公开、能核对的数据,不打分数,只给四档结论,每一项的依据都写在旁边。

  • 更新:近 90 天改了多少次代码、最近一次发版是哪天。7 天内有改动并且改得多或常发版,算「很活跃」;30 天内有改动算「活跃」;半年内算「放缓」;半年以上没动或者已经归档,算「停更」。
  • 问题处理:近 90 天新开的问题解决了几成、一般几天解决、外部提交的修改积压了多少。解决八成以上、一般一周内解决、积压不比合进去的多,算「好」;解决不到一半算「差」;其余算「一般」。新问题不到 10 个的不评。
  • 用的人:GitHub 收藏 5 万以上算很多,1 万以上算多,1 千以上算一般。旁边写近 7 天新增多少、多少人参与开发。
  • 用户口碑:用户评价满 5 条才算进来(注册不满 7 天的账号不算);平均分在 2.5 分及以下,总评降一档。
  • 总评四档:还在更新、问题处理好、用的人多 → 推荐;还在更新 → 不错;更新放缓或问题处理差 → 一般;半年以上没更新 → 谨慎。许可证有附加条件、商用受限的,单独提醒,不影响总评。
  • 收费软件(ChatGPT、Cursor 这类)没有公开的问题记录,就看 App Store:最近一次更新在 30 天内算「活跃」,半年内算「放缓」,半年以上算「停更」;打分人数 10 万以上算很多,1 万以上算多,1 千以上算一般;评分 4 分以上算好,2.5 分及以下算差,打分不到 100 人不评。再加上用户评价。

收藏数能刷,所以只占一项;更新和问题处理很难刷。数据每天更新,超过两周没更新的不评。

能替代它的

软件起步价难不难用中文开源口碑最近更新
VLMEvalKit免费要写代码没写明开源还没人评561 天前
Lm Evaluation Harness免费要写代码没有中文界面开源还没人评35 天前
FiftyOne免费要写代码没写明开源还没人评6 天前

看 VLMEvalKit 的全部替代品和对比 ›

最近更新和热度

  1. v0.2

    主要是内部改进和问题修复

  2. v0.1

    新增测评启动脚本,支持多视觉接口及多个评测数据集和模型

近 30 天 GitHub 收藏:+2

用户口碑

用户评价

还没有评价

写下你的看法,帮大家了解这款软件。

评分
评论公开可见,不要写出账号密码、验证码或订单号。

用户提问

还没有提问

有疑问就写下来,和大家一起聊聊。

提问公开可见,用过的人都能回答。

数据来源:GitHub,每天更新,更新时间 2026 年 10 月 6 日。 信息有误?告诉我们。

VLMEvalKit:是什么、要不要花钱、怎么用 | 模真真