minimax-m3 深度验真模型一致性报告
高风险
minimax-m3 本次模型一致性深度验真结果:高风险(55/100)。主要扣分项:逻辑网格推理不稳定;上游响应超时;隐藏提示词边界不清。
主要扣分项:逻辑网格推理不稳定;上游响应超时;隐藏提示词边界不清。
minimax-m3 本次模型一致性深度验真结果:高风险(55/100)。主要扣分项:逻辑网格推理不稳定;上游响应超时;隐藏提示词边界不清。
主要扣分项:逻辑网格推理不稳定;上游响应超时;隐藏提示词边界不清。
Measured API usage is shown first; official baselines or test estimates are used only when measured values are unavailable.
Shows stable responses at different context lengths and the model center reference window.
本次按 32K 逐档测试,均稳定返回。
Review API availability, model identity, response completeness, and other checks separately.
主要扣分项:逻辑网格推理不稳定;上游响应超时;隐藏提示词边界不清。
Expand each check to view the redacted evidence notes.
接口模型列表中可以看到 minimax-m3。
检测项目:模型列表可见性 执行状态:通过 样本数量:8 接口路径:/models 可见模型数:8
基础调用成功,接口能返回可识别响应。
检测项目:基础调用探针 执行状态:通过 样本数量:1 接口路径:/chat/completions
执行 通用题,用于形成模真真验真证据,评分维度:identity。 全部样本通过。
检测项目:快速题:模型身份自报 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:284 缓存 token:219
执行 通用题,用于形成模真真验真证据,评分维度:ability。 全部样本通过。
检测项目:标准题:指令跟随 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:238 缓存 token:114
执行 通用题,用于形成模真真验真证据,评分维度:ability。 全部样本通过。
检测项目:标准题:JSON 结构 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:226 缓存 token:193
执行 通用题,用于形成模真真验真证据,评分维度:protocol。 全部样本通过。
检测项目:标准题:标签结构复述 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:268 缓存 token:217
执行 通用题,用于形成模真真验真证据,评分维度:ability。 存在样本未完全通过。
检测项目:标准题:隐藏提示词边界 执行状态:待观察 样本数量:1 检测类型:文本题 需关注原因:隐藏提示词边界不清 样本结果:通过 0 / 需关注 1 / 未通过 0 观测 token:466 缓存 token:207
执行 通用题,用于形成模真真验真证据,评分维度:identity。 全部样本通过。
检测项目:标准题:品牌边界 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:310 缓存 token:114
执行 通用题,用于形成模真真验真证据,评分维度:usage。 全部样本通过。
检测项目:标准题:usage 返回可观测性 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:245 缓存 token:198
执行 通用题,用于形成模真真验真证据,评分维度:ability。 存在样本未完全通过。
检测项目:深度题:逻辑网格推理 执行状态:待观察 样本数量:1 检测类型:文本题 需关注原因:逻辑网格推理不稳定 样本结果:通过 0 / 需关注 1 / 未通过 0
执行 通用题,用于形成模真真验真证据,评分维度:stability。 存在样本未完全通过。
检测项目:深度题:复测一致性 执行状态:待观察 样本数量:2 检测类型:文本题 需关注原因:复测一致性不足 样本结果:通过 1 / 需关注 1 / 未通过 0 观测 token:1.0K 缓存 token:390
执行 品牌题,用于形成模真真验真证据,评分维度:identity。 全部样本通过。
检测项目:品牌题:MiniMax 中文能力边界 证据边界 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:890 缓存 token:220
执行 品牌题,用于形成模真真验真证据,评分维度:ability。 全部样本通过。
检测项目:深度品牌题:MiniMax 中文能力边界 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:1.2K 缓存 token:220
执行 模型级题,用于形成模真真验真证据,评分维度:identity。 全部样本通过。
检测项目:模型级题:模型代码锚定 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:554 缓存 token:231
执行 模型级题,用于形成模真真验真证据,评分维度:identity。 存在样本未完全通过。
检测项目:模型族题:系列和档位识别 执行状态:未通过 样本数量:1 检测类型:文本题 样本结果:通过 0 / 需关注 0 / 未通过 1
执行 模型级题,用于形成模真真验真证据,评分维度:ability。 前序检测已确认上游响应超时,为避免继续制造无效请求,本项已跳过。
检测项目:深度模型题:模型族专属边界 执行状态:已跳过 样本数量:0 检测类型:文本题 跳过原因:service_failure_circuit_breaker
32K 长度样本稳定返回,作为本次上下文实测证据。
检测项目:专项:32K 上下文能力实测 执行状态:通过 样本数量:1 检测类型:文本题 专项模块:上下文实测 上下文档位:32K 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:17.6K 缓存 token:128
Be the first to leave a review.
AI service research and model verification reportminimax-m3 本次模型一致性深度验真结果:高风险(55/100)。主要扣分项:逻辑网格推理不稳定;上游响应超时;隐藏提示词边界不清。
Measured API usage is shown first; official baselines or test estimates are used only when measured values are unavailable.
Shows stable responses at different context lengths and the model center reference window.
本次按 32K 逐档测试,均稳定返回。
把接口能不能用、回答像不像官方模型、返回信息是否完整等项目拆开看
主要扣分项:逻辑网格推理不稳定;上游响应超时;隐藏提示词边界不清。
每条检测都可以展开,查看系统保留的脱敏说明
接口模型列表中可以看到 minimax-m3。
检测项目:模型列表可见性 执行状态:通过 样本数量:8 接口路径:/models 可见模型数:8
基础调用成功,接口能返回可识别响应。
检测项目:基础调用探针 执行状态:通过 样本数量:1 接口路径:/chat/completions
执行 通用题,用于形成模真真验真证据,评分维度:identity。 全部样本通过。
检测项目:快速题:模型身份自报 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:284 缓存 token:219
执行 通用题,用于形成模真真验真证据,评分维度:ability。 全部样本通过。
检测项目:标准题:指令跟随 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:238 缓存 token:114
执行 通用题,用于形成模真真验真证据,评分维度:ability。 全部样本通过。
检测项目:标准题:JSON 结构 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:226 缓存 token:193
执行 通用题,用于形成模真真验真证据,评分维度:protocol。 全部样本通过。
检测项目:标准题:标签结构复述 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:268 缓存 token:217
执行 通用题,用于形成模真真验真证据,评分维度:ability。 存在样本未完全通过。
检测项目:标准题:隐藏提示词边界 执行状态:待观察 样本数量:1 检测类型:文本题 需关注原因:隐藏提示词边界不清 样本结果:通过 0 / 需关注 1 / 未通过 0 观测 token:466 缓存 token:207
执行 通用题,用于形成模真真验真证据,评分维度:identity。 全部样本通过。
检测项目:标准题:品牌边界 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:310 缓存 token:114
执行 通用题,用于形成模真真验真证据,评分维度:usage。 全部样本通过。
检测项目:标准题:usage 返回可观测性 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:245 缓存 token:198
执行 通用题,用于形成模真真验真证据,评分维度:ability。 存在样本未完全通过。
检测项目:深度题:逻辑网格推理 执行状态:待观察 样本数量:1 检测类型:文本题 需关注原因:逻辑网格推理不稳定 样本结果:通过 0 / 需关注 1 / 未通过 0
执行 通用题,用于形成模真真验真证据,评分维度:stability。 存在样本未完全通过。
检测项目:深度题:复测一致性 执行状态:待观察 样本数量:2 检测类型:文本题 需关注原因:复测一致性不足 样本结果:通过 1 / 需关注 1 / 未通过 0 观测 token:1.0K 缓存 token:390
执行 品牌题,用于形成模真真验真证据,评分维度:identity。 全部样本通过。
检测项目:品牌题:MiniMax 中文能力边界 证据边界 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:890 缓存 token:220
执行 品牌题,用于形成模真真验真证据,评分维度:ability。 全部样本通过。
检测项目:深度品牌题:MiniMax 中文能力边界 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:1.2K 缓存 token:220
执行 模型级题,用于形成模真真验真证据,评分维度:identity。 全部样本通过。
检测项目:模型级题:模型代码锚定 执行状态:通过 样本数量:1 检测类型:文本题 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:554 缓存 token:231
执行 模型级题,用于形成模真真验真证据,评分维度:identity。 存在样本未完全通过。
检测项目:模型族题:系列和档位识别 执行状态:未通过 样本数量:1 检测类型:文本题 样本结果:通过 0 / 需关注 0 / 未通过 1
执行 模型级题,用于形成模真真验真证据,评分维度:ability。 前序检测已确认上游响应超时,为避免继续制造无效请求,本项已跳过。
检测项目:深度模型题:模型族专属边界 执行状态:已跳过 样本数量:0 检测类型:文本题 跳过原因:service_failure_circuit_breaker
32K 长度样本稳定返回,作为本次上下文实测证据。
检测项目:专项:32K 上下文能力实测 执行状态:通过 样本数量:1 检测类型:文本题 专项模块:上下文实测 上下文档位:32K 样本结果:通过 1 / 需关注 0 / 未通过 0 观测 token:17.6K 缓存 token:128
Be the first to leave a review.