claude-opus-4-6 deep verification model-consistency report
Matched
claude-opus-4-6 deep verification result: Matched (86/100). Main deductions: Upstream response timed out; Failed evidence items were found.
主要扣分项:上游响应超时;存在Failed证据项。
claude-opus-4-6 deep verification result: Matched (86/100). Main deductions: Upstream response timed out; Failed evidence items were found.
主要扣分项:上游响应超时;存在Failed证据项。
Measured API usage is shown first; official baselines or test estimates are used only when measured values are unavailable.
Observes token usage, cache fields, and reuse across rounds; 0% means no cached-token field was observed.
接口返回了实际 Token,但本次响应没有可识别的缓存 Token 字段;可能是渠道不返回、请求未命中或字段未被解析。
Shows stable responses at different context lengths and the model center reference window.
950K Failed,原因:接口鉴权或权限异常。
950K 档暂不作为当前线路的稳定上下文参考。
Review API availability, model identity, response completeness, and other checks separately.
主要扣分项:上游响应超时;存在Failed证据项。
Expand each check to view the redacted evidence notes.
claude-opus-4-6 is visible in the API model list.
Check: Model list visibility Status: Passed Samples: 7 API path: /v1/models Visible models: 7
The basic API call succeeded and returned a recognizable response.
Check: Basic call probe Status: Passed Samples: 1 API path: /v1/chat/completions
直接询问模型身份,作为低权重红旗信号;自报只能提示明显不一致,不能单独证明官方身份。 全部样本Passed。
Check: Quick test: model self-identification Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 517
要求模型按指定标记回复,判断基础指令跟随和响应可控性。 全部样本Passed。
Check: Standard test: instruction following Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 83
要求模型输出固定 JSON,判断结构化响应是否稳定。 全部样本Passed。
Check: Standard test: JSON structure Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 409
要求模型不要伪造官方身份,判断品牌表述是否克制。 全部样本Passed。
Check: Standard test: brand boundary Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 527
观察模型是否会克制说明隐藏思考和签名特征不能被随意伪造。 全部样本Passed。
Check: 品牌题:Claude 思考边界 Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 219
要求模型把本次被检测模型代码、品牌归类和固定标记写入 JSON,便于应用层精确校验。 全部样本Passed。
Check: Model-specific test: model-code anchoring Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 503
按模型代码识别系列或档位,覆盖 Opus/Sonnet/Haiku、GPT/o/Codex、Gemini Pro/Flash、GLM、Kimi、MiniMax 等模型族。 全部样本Passed。
Check: Model-family test: series and tier identification Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 476
要求短输出并检查响应 usage 是否可被应用层读取,支撑预计消耗与实际消耗对照。 全部样本Passed。
Check: Standard test: usage observability Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 417
观察模型是否会克制处理隐藏思考、系统提示和签名特征,不伪造 Claude 专属内部证据。 存在样本未完全Passed。
Check: Deep brand test: Claude hidden-reasoning boundary Status: Failed Samples: 1 Test type: Text test Results: Passed 0 / Needs review 0 / Failed 1
针对当前品牌和模型族补充独特边界题,避免只用通用题判断高价值模型。 前序检测已确认上游响应超时,为避免继续制造无效请求,本项已跳过。
Check: Deep model test: family-specific boundary Status: Skipped Samples: 0 Test type: Text test 跳过原因:service_failure_circuit_breaker
同一低温题连续复测两次,观察是否能保持一致响应。 前序检测已确认上游响应超时,为避免继续制造无效请求,本项已跳过。
Check: Deep test: retest consistency Status: Skipped Samples: 0 Test type: Text test 跳过原因:service_failure_circuit_breaker
同一长前缀连续请求 5 次,应用层观察 usage、cache usage、token 消耗和费用风险。 存在样本未完全Passed。
Check: Specialty test: token cache usage over 5 rounds Status: Needs review Samples: 5 Test type: Text test Specialty: Token cache usage test (may affect real billing) Needs review原因:缓存用量字段不可观测 Results: Passed 5 / Needs review 1 / Failed 0 Observed tokens: 49.6K
950K 长度样本未形成稳定结果,本次按边界样本记录。
Check: 专项:950K 上下文实测 Status: Failed Samples: 1 Test type: Text test Specialty: Context test Context tier: 950K Needs review原因:接口鉴权或权限异常 Results: Passed 0 / Needs review 0 / Failed 1
Be the first to leave a review.
AI service research and model verification reportclaude-opus-4-6 deep verification result: Matched (86/100). Main deductions: Upstream response timed out; Failed evidence items were found.
Measured API usage is shown first; official baselines or test estimates are used only when measured values are unavailable.
Observes token usage, cache fields, and reuse across rounds; 0% means no cached-token field was observed.
接口返回了实际 Token,但本次响应没有可识别的缓存 Token 字段;可能是渠道不返回、请求未命中或字段未被解析。
Shows stable responses at different context lengths and the model center reference window.
950K Failed,原因:接口鉴权或权限异常。
950K 档暂不作为当前线路的稳定上下文参考。
Review API availability, model identity, response completeness, and other checks separately.
主要扣分项:上游响应超时;存在Failed证据项。
Expand each check to view the redacted evidence notes.
claude-opus-4-6 is visible in the API model list.
Check: Model list visibility Status: Passed Samples: 7 API path: /v1/models Visible models: 7
The basic API call succeeded and returned a recognizable response.
Check: Basic call probe Status: Passed Samples: 1 API path: /v1/chat/completions
直接询问模型身份,作为低权重红旗信号;自报只能提示明显不一致,不能单独证明官方身份。 全部样本Passed。
Check: Quick test: model self-identification Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 517
要求模型按指定标记回复,判断基础指令跟随和响应可控性。 全部样本Passed。
Check: Standard test: instruction following Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 83
要求模型输出固定 JSON,判断结构化响应是否稳定。 全部样本Passed。
Check: Standard test: JSON structure Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 409
要求模型不要伪造官方身份,判断品牌表述是否克制。 全部样本Passed。
Check: Standard test: brand boundary Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 527
观察模型是否会克制说明隐藏思考和签名特征不能被随意伪造。 全部样本Passed。
Check: 品牌题:Claude 思考边界 Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 219
要求模型把本次被检测模型代码、品牌归类和固定标记写入 JSON,便于应用层精确校验。 全部样本Passed。
Check: Model-specific test: model-code anchoring Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 503
按模型代码识别系列或档位,覆盖 Opus/Sonnet/Haiku、GPT/o/Codex、Gemini Pro/Flash、GLM、Kimi、MiniMax 等模型族。 全部样本Passed。
Check: Model-family test: series and tier identification Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 476
要求短输出并检查响应 usage 是否可被应用层读取,支撑预计消耗与实际消耗对照。 全部样本Passed。
Check: Standard test: usage observability Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 417
观察模型是否会克制处理隐藏思考、系统提示和签名特征,不伪造 Claude 专属内部证据。 存在样本未完全Passed。
Check: Deep brand test: Claude hidden-reasoning boundary Status: Failed Samples: 1 Test type: Text test Results: Passed 0 / Needs review 0 / Failed 1
针对当前品牌和模型族补充独特边界题,避免只用通用题判断高价值模型。 前序检测已确认上游响应超时,为避免继续制造无效请求,本项已跳过。
Check: Deep model test: family-specific boundary Status: Skipped Samples: 0 Test type: Text test 跳过原因:service_failure_circuit_breaker
同一低温题连续复测两次,观察是否能保持一致响应。 前序检测已确认上游响应超时,为避免继续制造无效请求,本项已跳过。
Check: Deep test: retest consistency Status: Skipped Samples: 0 Test type: Text test 跳过原因:service_failure_circuit_breaker
同一长前缀连续请求 5 次,应用层观察 usage、cache usage、token 消耗和费用风险。 存在样本未完全Passed。
Check: Specialty test: token cache usage over 5 rounds Status: Needs review Samples: 5 Test type: Text test Specialty: Token cache usage test (may affect real billing) Needs review原因:缓存用量字段不可观测 Results: Passed 5 / Needs review 1 / Failed 0 Observed tokens: 49.6K
950K 长度样本未形成稳定结果,本次按边界样本记录。
Check: 专项:950K 上下文实测 Status: Failed Samples: 1 Test type: Text test Specialty: Context test Context tier: 950K Needs review原因:接口鉴权或权限异常 Results: Passed 0 / Needs review 0 / Failed 1
Be the first to leave a review.