claude-sonnet-4-6 standard verification model-consistency report
Doubtful
claude-sonnet-4-6 本次模型一致性标准验真结果:Doubtful(68/100)。主要扣分项:模型代码锚定不稳定;指令跟随不稳定;模型族识别不稳定。
主要扣分项:模型代码锚定不稳定;指令跟随不稳定;模型族识别不稳定。
claude-sonnet-4-6 本次模型一致性标准验真结果:Doubtful(68/100)。主要扣分项:模型代码锚定不稳定;指令跟随不稳定;模型族识别不稳定。
主要扣分项:模型代码锚定不稳定;指令跟随不稳定;模型族识别不稳定。
Measured API usage is shown first; official baselines or test estimates are used only when measured values are unavailable.
Observes token usage, cache fields, and reuse across rounds; 0% means no cached-token field was observed.
Cached tokens were observed, but the share is low. Review API parameters, context reuse, and billing methodology.
Shows stable responses at different context lengths and the model center reference window.
16K 需要关注,原因:上下文保持较弱。
16K 档暂不作为当前线路的稳定上下文参考。
Review API availability, model identity, response completeness, and other checks separately.
主要扣分项:模型代码锚定不稳定;指令跟随不稳定;模型族识别不稳定。
Expand each check to view the redacted evidence notes.
claude-sonnet-4-6 is visible in the API model list.
Check: Model list visibility Status: Passed Samples: 6 API path: /v1/models Visible models: 6
The basic API call succeeded and returned a recognizable response.
Check: Basic call probe Status: Passed Samples: 1 API path: /v1/chat/completions
直接询问模型身份,作为低权重红旗信号;自报只能提示明显不一致,不能单独证明官方身份。 全部样本Passed。
Check: Quick test: model self-identification Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 155
要求模型按指定标记回复,判断基础指令跟随和响应可控性。 存在样本未完全Passed。
Check: Standard test: instruction following Status: Needs review Samples: 1 Test type: Text test Needs review原因:指令跟随不稳定 Results: Passed 0 / Needs review 1 / Failed 0
要求模型输出固定 JSON,判断结构化响应是否稳定。 全部样本Passed。
Check: Standard test: JSON structure Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 487
要求模型不要伪造官方身份,判断品牌表述是否克制。 全部样本Passed。
Check: Standard test: brand boundary Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 182
观察模型是否会克制说明隐藏思考和签名特征不能被随意伪造。 存在样本未完全Passed。
Check: 品牌题:Claude 思考边界 Status: Needs review Samples: 1 Test type: Text test Needs review原因:品牌边界表达不清 Results: Passed 0 / Needs review 1 / Failed 0
要求模型把本次被检测模型代码、品牌归类和固定标记写入 JSON,便于应用层精确校验。 存在样本未完全Passed。
Check: Model-specific test: model-code anchoring Status: Needs review Samples: 1 Test type: Text test Needs review原因:模型代码锚定不稳定 Results: Passed 0 / Needs review 1 / Failed 0
按模型代码识别系列或档位,覆盖 Opus/Sonnet/Haiku、GPT/o/Codex、Gemini Pro/Flash、GLM、Kimi、MiniMax 等模型族。 存在样本未完全Passed。
Check: Model-family test: series and tier identification Status: Needs review Samples: 1 Test type: Text test Needs review原因:模型族识别不稳定 Results: Passed 0 / Needs review 1 / Failed 0
要求短输出并检查响应 usage 是否可被应用层读取,支撑预计消耗与实际消耗对照。 全部样本Passed。
Check: Standard test: usage observability Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 500
同一长前缀连续请求 5 次,应用层观察 usage、cache usage、token 消耗和费用风险。 全部样本Passed。
Check: Specialty test: token cache usage over 5 rounds Status: Passed Samples: 5 Test type: Text test Specialty: Token cache usage test (may affect real billing) Results: Passed 5 / Needs review 0 / Failed 0 Observed tokens: 50.5K Cached tokens: 30.5K
8K context sample returned reliably and is included as evidence for this run.
Check: 专项:8K 上下文能力实测 Status: Passed Samples: 1 Test type: Text test Specialty: 上下文能力实测 Context tier: 8K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 7.8K
16K 长度样本未形成稳定结果,本次按边界样本记录。
Check: 专项:16K 上下文能力实测 Status: Needs review Samples: 1 Test type: Text test Specialty: 上下文能力实测 Context tier: 16K Needs review原因:上下文保持较弱 Results: Passed 0 / Needs review 1 / Failed 0
Be the first to leave a review.
AI service research and model verification reportclaude-sonnet-4-6 本次模型一致性标准验真结果:Doubtful(68/100)。主要扣分项:模型代码锚定不稳定;指令跟随不稳定;模型族识别不稳定。
Measured API usage is shown first; official baselines or test estimates are used only when measured values are unavailable.
Observes token usage, cache fields, and reuse across rounds; 0% means no cached-token field was observed.
Cached tokens were observed, but the share is low. Review API parameters, context reuse, and billing methodology.
Shows stable responses at different context lengths and the model center reference window.
16K 需要关注,原因:上下文保持较弱。
16K 档暂不作为当前线路的稳定上下文参考。
Review API availability, model identity, response completeness, and other checks separately.
主要扣分项:模型代码锚定不稳定;指令跟随不稳定;模型族识别不稳定。
Expand each check to view the redacted evidence notes.
claude-sonnet-4-6 is visible in the API model list.
Check: Model list visibility Status: Passed Samples: 6 API path: /v1/models Visible models: 6
The basic API call succeeded and returned a recognizable response.
Check: Basic call probe Status: Passed Samples: 1 API path: /v1/chat/completions
直接询问模型身份,作为低权重红旗信号;自报只能提示明显不一致,不能单独证明官方身份。 全部样本Passed。
Check: Quick test: model self-identification Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 155
要求模型按指定标记回复,判断基础指令跟随和响应可控性。 存在样本未完全Passed。
Check: Standard test: instruction following Status: Needs review Samples: 1 Test type: Text test Needs review原因:指令跟随不稳定 Results: Passed 0 / Needs review 1 / Failed 0
要求模型输出固定 JSON,判断结构化响应是否稳定。 全部样本Passed。
Check: Standard test: JSON structure Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 487
要求模型不要伪造官方身份,判断品牌表述是否克制。 全部样本Passed。
Check: Standard test: brand boundary Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 182
观察模型是否会克制说明隐藏思考和签名特征不能被随意伪造。 存在样本未完全Passed。
Check: 品牌题:Claude 思考边界 Status: Needs review Samples: 1 Test type: Text test Needs review原因:品牌边界表达不清 Results: Passed 0 / Needs review 1 / Failed 0
要求模型把本次被检测模型代码、品牌归类和固定标记写入 JSON,便于应用层精确校验。 存在样本未完全Passed。
Check: Model-specific test: model-code anchoring Status: Needs review Samples: 1 Test type: Text test Needs review原因:模型代码锚定不稳定 Results: Passed 0 / Needs review 1 / Failed 0
按模型代码识别系列或档位,覆盖 Opus/Sonnet/Haiku、GPT/o/Codex、Gemini Pro/Flash、GLM、Kimi、MiniMax 等模型族。 存在样本未完全Passed。
Check: Model-family test: series and tier identification Status: Needs review Samples: 1 Test type: Text test Needs review原因:模型族识别不稳定 Results: Passed 0 / Needs review 1 / Failed 0
要求短输出并检查响应 usage 是否可被应用层读取,支撑预计消耗与实际消耗对照。 全部样本Passed。
Check: Standard test: usage observability Status: Passed Samples: 1 Test type: Text test Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 500
同一长前缀连续请求 5 次,应用层观察 usage、cache usage、token 消耗和费用风险。 全部样本Passed。
Check: Specialty test: token cache usage over 5 rounds Status: Passed Samples: 5 Test type: Text test Specialty: Token cache usage test (may affect real billing) Results: Passed 5 / Needs review 0 / Failed 0 Observed tokens: 50.5K Cached tokens: 30.5K
8K context sample returned reliably and is included as evidence for this run.
Check: 专项:8K 上下文能力实测 Status: Passed Samples: 1 Test type: Text test Specialty: 上下文能力实测 Context tier: 8K Results: Passed 1 / Needs review 0 / Failed 0 Observed tokens: 7.8K
16K 长度样本未形成稳定结果,本次按边界样本记录。
Check: 专项:16K 上下文能力实测 Status: Needs review Samples: 1 Test type: Text test Specialty: 上下文能力实测 Context tier: 16K Needs review原因:上下文保持较弱 Results: Passed 0 / Needs review 1 / Failed 0
Be the first to leave a review.