claude-opus-4-6 deep verification model-consistency report
Highly matched
claude-opus-4-6 deep verification result: Highly matched (100/100). All primary checks passed in this run.
All primary checks passed in this run.
claude-opus-4-6 deep verification result: Highly matched (100/100). All primary checks passed in this run.
All primary checks passed in this run.
Measured API usage is shown first; official baselines or test estimates are used only when measured values are unavailable.
Observes token usage, cache fields, and reuse across rounds; 0% means no cached-token field was observed.
接口返回了实际 Token,但本次响应没有可识别的缓存 Token 字段;可能是渠道不返回、请求未命中或字段未被解析。
Shows stable responses at different context lengths and the model center reference window.
All tested context tiers (950K / 800K / 400K / 200K / 100K / 64K / 32K) returned reliably.
Review API availability, model identity, response completeness, and other checks separately.
All primary checks passed in this run.
Expand each check to view the redacted evidence notes.
claude-opus-4-6 is visible in the API model list.
Check: Model list visibility Status: Passed Samples: 8 API path: /v1/models Visible models: 8
The basic API call succeeded and returned a recognizable response.
Check: Basic call probe Status: Passed Samples: 1 API path: /v1/chat/completions
直接询问模型身份,作为低权重红旗信号;自报只能提示明显不一致,不能单独证明官方身份。 全部样本Passed。
Check: Quick test: model self-identification Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 272
要求模型按指定标记回复,判断基础指令跟随和响应可控性。 全部样本Passed。
Check: Standard test: instruction following Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 41
要求模型输出固定 JSON,判断结构化响应是否稳定。 全部样本Passed。
Check: Standard test: JSON structure Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 75
要求模型不要伪造官方身份,判断品牌表述是否克制。 全部样本Passed。
Check: Standard test: brand boundary Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 221
观察模型是否会克制说明隐藏思考和签名特征不能被随意伪造。 全部样本Passed。
Check: 品牌题:Claude 思考边界 Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 237
要求模型把本次被检测模型代码、品牌归类和固定标记写入 JSON,便于应用层精确校验。 全部样本Passed。
Check: Model-specific test: model-code anchoring Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 178
按模型代码识别系列或档位,覆盖 Opus/Sonnet/Haiku、GPT/o/Codex、Gemini Pro/Flash、GLM、Kimi、MiniMax 等模型族。 全部样本Passed。
Check: Model-family test: series and tier identification Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 119
要求短输出并检查响应 usage 是否可被应用层读取,支撑预计消耗与实际消耗对照。 全部样本Passed。
Check: Standard test: usage observability Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 60
观察模型是否会克制处理隐藏思考、系统提示和签名特征,不伪造 Claude 专属内部证据。 全部样本Passed。
Check: Deep brand test: Claude hidden-reasoning boundary Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 231
针对当前品牌和模型族补充独特边界题,避免只用通用题判断高价值模型。 全部样本Passed。
Check: Deep model test: family-specific boundary Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 319
同一低温题连续复测两次,观察是否能保持一致响应。 全部样本Passed。
Check: Deep test: retest consistency Status: Passed Samples: 2 Test type: Text test Results: Passed 2 / Needs review 0 / Failed 0 Observed tokens: 112
同一长前缀连续请求 5 次,应用层观察 usage、cache usage、token 消耗和费用风险。 存在样本未完全Passed。
Check: Specialty test: token cache usage over 5 rounds Status: Needs review Samples: 5 Test type: Text test Specialty: Token cache usage test (may affect real billing) Needs review原因:缓存用量字段不可观测 Results: Passed 5 / Needs review 1 / Failed 0 Observed tokens: 48.7K
950K context sample returned reliably and is included as evidence for this run.
Check: 专项:950K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 950K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 850.0K
800K context sample returned reliably and is included as evidence for this run.
Check: 专项:800K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 800K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 715.8K
400K context sample returned reliably and is included as evidence for this run.
Check: 专项:400K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 400K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 357.9K
200K context sample returned reliably and is included as evidence for this run.
Check: 专项:200K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 200K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 179.0K
100K context sample returned reliably and is included as evidence for this run.
Check: 专项:100K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 100K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 89.5K
64K context sample returned reliably and is included as evidence for this run.
Check: 专项:64K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 64K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 58.2K
32K context sample returned reliably and is included as evidence for this run.
Check: 专项:32K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 32K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 29.1K
Be the first to leave a review.
AI service research and model verification reportclaude-opus-4-6 deep verification result: Highly matched (100/100). All primary checks passed in this run.
Measured API usage is shown first; official baselines or test estimates are used only when measured values are unavailable.
Observes token usage, cache fields, and reuse across rounds; 0% means no cached-token field was observed.
接口返回了实际 Token,但本次响应没有可识别的缓存 Token 字段;可能是渠道不返回、请求未命中或字段未被解析。
Shows stable responses at different context lengths and the model center reference window.
All tested context tiers (950K / 800K / 400K / 200K / 100K / 64K / 32K) returned reliably.
Review API availability, model identity, response completeness, and other checks separately.
All primary checks passed in this run.
Expand each check to view the redacted evidence notes.
claude-opus-4-6 is visible in the API model list.
Check: Model list visibility Status: Passed Samples: 8 API path: /v1/models Visible models: 8
The basic API call succeeded and returned a recognizable response.
Check: Basic call probe Status: Passed Samples: 1 API path: /v1/chat/completions
直接询问模型身份,作为低权重红旗信号;自报只能提示明显不一致,不能单独证明官方身份。 全部样本Passed。
Check: Quick test: model self-identification Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 272
要求模型按指定标记回复,判断基础指令跟随和响应可控性。 全部样本Passed。
Check: Standard test: instruction following Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 41
要求模型输出固定 JSON,判断结构化响应是否稳定。 全部样本Passed。
Check: Standard test: JSON structure Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 75
要求模型不要伪造官方身份,判断品牌表述是否克制。 全部样本Passed。
Check: Standard test: brand boundary Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 221
观察模型是否会克制说明隐藏思考和签名特征不能被随意伪造。 全部样本Passed。
Check: 品牌题:Claude 思考边界 Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 237
要求模型把本次被检测模型代码、品牌归类和固定标记写入 JSON,便于应用层精确校验。 全部样本Passed。
Check: Model-specific test: model-code anchoring Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 178
按模型代码识别系列或档位,覆盖 Opus/Sonnet/Haiku、GPT/o/Codex、Gemini Pro/Flash、GLM、Kimi、MiniMax 等模型族。 全部样本Passed。
Check: Model-family test: series and tier identification Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 119
要求短输出并检查响应 usage 是否可被应用层读取,支撑预计消耗与实际消耗对照。 全部样本Passed。
Check: Standard test: usage observability Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 60
观察模型是否会克制处理隐藏思考、系统提示和签名特征,不伪造 Claude 专属内部证据。 全部样本Passed。
Check: Deep brand test: Claude hidden-reasoning boundary Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 231
针对当前品牌和模型族补充独特边界题,避免只用通用题判断高价值模型。 全部样本Passed。
Check: Deep model test: family-specific boundary Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 319
同一低温题连续复测两次,观察是否能保持一致响应。 全部样本Passed。
Check: Deep test: retest consistency Status: Passed Samples: 2 Test type: Text test Results: Passed 2 / Needs review 0 / Failed 0 Observed tokens: 112
同一长前缀连续请求 5 次,应用层观察 usage、cache usage、token 消耗和费用风险。 存在样本未完全Passed。
Check: Specialty test: token cache usage over 5 rounds Status: Needs review Samples: 5 Test type: Text test Specialty: Token cache usage test (may affect real billing) Needs review原因:缓存用量字段不可观测 Results: Passed 5 / Needs review 1 / Failed 0 Observed tokens: 48.7K
950K context sample returned reliably and is included as evidence for this run.
Check: 专项:950K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 950K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 850.0K
800K context sample returned reliably and is included as evidence for this run.
Check: 专项:800K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 800K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 715.8K
400K context sample returned reliably and is included as evidence for this run.
Check: 专项:400K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 400K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 357.9K
200K context sample returned reliably and is included as evidence for this run.
Check: 专项:200K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 200K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 179.0K
100K context sample returned reliably and is included as evidence for this run.
Check: 专项:100K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 100K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 89.5K
64K context sample returned reliably and is included as evidence for this run.
Check: 专项:64K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 64K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 58.2K
32K context sample returned reliably and is included as evidence for this run.
Check: 专项:32K 上下文实测 Status: Passed Samples: 1 Test type: Text test Specialty: Context test Context tier: 32K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 29.1K
Be the first to leave a review.