验真报告 · 公开证据

公开验真报告库

只展示已公开、已脱敏的模型一致性验真报告,按检测发布时间排序

公开报告11
通过报告11
高异常0
当前筛选匹配 / 标准验真 / 低异常共 11 份报告

报告列表

发起验真
标准验真gpt-5.5 标准验真模型一致性报告gpt-5.5 本次模型一致性标准验真结果:匹配(86/100)。主要扣分项:网关暂不可用;存在未通过证据项。UU API · GPT-5.5 · 样本 15 · 08/01 09:12匹配86/100标准验真gpt-5.6-luna 标准验真模型一致性报告gpt-5.6-luna 本次模型一致性标准验真结果:匹配(86/100)。主要扣分项:网关暂不可用;存在未通过证据项。UU API · GPT-5.6 Luna · 样本 16 · 07/31 09:54匹配86/100标准验真gpt-5.6-luna 标准验真模型一致性报告gpt-5.6-luna 本次模型一致性标准验真结果:匹配(86/100)。主要扣分项:网关暂不可用;存在未通过证据项。UU API · GPT-5.6 Luna · 样本 13 · 07/31 08:50匹配86/100标准验真gpt-5.6-sol 标准验真模型一致性报告gpt-5.6-sol 本次模型一致性标准验真结果:匹配(86/100)。主要扣分项:上游响应超时;存在未通过证据项。零壹跃迁 · GPT-5.6 Sol · 样本 17 · 07/31 05:28匹配86/100标准验真gpt-5.6-luna 标准验真模型一致性报告gpt-5.6-luna 本次模型一致性标准验真结果:匹配(86/100)。主要扣分项:网关暂不可用;存在未通过证据项。零壹跃迁 · GPT-5.6 Luna · 样本 13 · 07/31 05:08匹配86/100标准验真claude-sonnet-5 标准验真模型一致性报告claude-sonnet-5 本次模型一致性标准验真结果:匹配(91/100)。主要扣分项:隐藏提示词边界不清。UU API · Claude Sonnet 5 · 样本 22 · 07/29 12:41匹配91/100标准验真kimi-k2.6 标准验真模型一致性报告kimi-k2.6 本次模型一致性标准验真结果:匹配(86/100)。主要扣分项:上游响应超时;存在未通过证据项。xinlicloud.top · Kimi K2.6 · 样本 22 · 07/22 17:26匹配86/100标准验真claude-fable-5 标准验真模型一致性报告claude-fable-5 本次模型一致性标准验真结果:匹配(92/100)。主要扣分项:指令跟随不稳定。无限星河AI · Claude Fable 5 · 样本 29 · 07/09 11:15匹配92/100标准验真claude-opus-4-8 标准验真模型一致性报告claude-opus-4-8 本次模型一致性标准验真结果:匹配(87/100)。主要扣分项:模型代码锚定不稳定。无限星河AI · Claude Opus 4.8 · 样本 30 · 07/09 11:12匹配87/100标准验真qwen3.5-flash 标准验真模型一致性报告qwen3.5-flash 本次模型一致性标准验真结果:匹配(88/100)。主要扣分项:接口服务异常。无限星河AI · Qwen3.5 Flash · 样本 102 · 07/08 13:12匹配88/100标准验真gpt-5.4-mini 标准验真模型一致性报告gpt-5.4-mini 本次模型一致性标准验真结果:匹配(88/100)。主要扣分项:接口服务异常。iksvip · GPT-5.4 mini · 样本 25 · 07/02 22:09匹配88/100
每页显示
第 1-11 份 / 共 11 份报告