# MODELOC 13 项大模型原厂通道无损探测技术规范与验证矩阵 > **版本**:v2.6 (2026.09) > **制定机构**:MODELOC 独立模型可观测性实验室 & 极智 API 技术委员会 > **适用范围**:OpenAI、Anthropic、Google、DeepSeek 全系大模型原厂协议无损透传验证 > **核心原则**:不信任任何宣称,以二进制响应流、原厂指纹、统计熵值与端到端可复现性为唯一判定准则。 --- ## 一、 背景与检测宗旨 在 LLM API 聚合调度行业中,常见“偷换降级模型(将 Sonnet 换为 Haiku 或廉价小模型)”、“截断/清洗思考链(Thinking tokens 丢失)”、“伪造 Prompt Caching 虚标扣费”、“隐式上下文窗口截断”等非规范行为,严重损害高校科研实验的可复现性与学术严谨性。 MODELOC 设立 13 项无损探针(Probe-01 至 Probe-13),采用自动化黑盒压测与统计抽样对网关节点实施每 15 分钟一次的持续探测。任何一项探针未达标,节点即时触发告警并自动下线。 --- ## 二、 13 项底层检测探针技术规范 ### 1. Probe-01: System Fingerprint (原厂系统指纹一致性) * **检测对象**:OpenAI 全系模型 (`gpt-6-astra`, `gpt-5.6-sol`, `o3-mini`) * **检测机制**:抓取响应体中的 `system_fingerprint` 字段,比对该字段与 OpenAI 官方集群当周轮换指纹库的一致性。 * **通过准则**:指纹字段必须真实存在且符合原厂命名规范 (`fp_xxxx`),严禁出现固定假指纹或空字段。 ### 2. Probe-02: Extended Thinking Stream Integrity (深度思考链透传) * **检测对象**:Anthropic (`claude-sonnet-5`, `claude-opus-4-6`) * **检测机制**:在传入 `thinking: {"type": "enabled", "budget_tokens": 4096}` 参数后,解析 SSE 流式返回的 `content_block_start` (`type: thinking`) 与 `content_block_delta` (`type: thinking_delta`)。 * **通过准则**:思考过程必须原样逐 Token 推送,不得被网关截断、过滤或折叠后统一吐出,思考过程 Token 计数必须与 `usage.thinking_tokens` 严格自洽。实际 reasoning / thinking 内容及其可见性由上游 Provider、模型版本及 API 参数决定。 ### 3. Probe-03: Tool / Function Calling Schema 规范符合度 * **检测对象**:全系旗舰模型 * **检测机制**:注入包含 3 层嵌套 JSON Schema 的多工具定义(如复合学术文献结构化抽取),要求模型并发调用多工具。 * **通过准则**:必须返回原厂规范的 `tool_calls` 结构与合法 JSON 参数,解析错误率必须为 0。 ### 4. Probe-04: Token Logprob & Entropy Distribution (Token 概率熵值防偷换) * **检测对象**:OpenAI 及兼容模型 * **检测机制**:传入固定学术推理问题,设置 `logprobs=True, top_logprobs=5`,收集首 50 个生成 Token 的概率对数并计算香农信息熵。 * **通过准则**:大模型的 Logprob 熵值分布与廉价小模型存在统计学显著差异。若抽检分布漂移至对应小模型基准线(p < 0.01),判定为模型降级掺水。 ### 5. Probe-05: Context Window Saturation (真实大上下文饱和度压测) * **检测对象**:128k / 200k / 100万 上下文模型 * **检测机制**:将真实学术论文灌入至额定上下文的 90% 容量(如 180k Tokens),在文本前中后随机埋入 "Needle" 事实问题。 * **通过准则**:必须完整召回埋入事实(Needle In A Haystack 准确率 > 99.5%),排查任何在反向代理层通过粗暴截断节省成本的行为。 ### 6. Probe-06: Prompt Caching Hit Ratio & 真实资费核验 * **检测对象**:OpenAI / Anthropic * **检测机制**:以 60 秒间隔连续发起两轮完全相同的 10,000 Token 学术背景请求。 * **通过准则**:第二轮响应中,`cached_tokens` 必须精确命中(> 9,000 Tokens),且网关计费扣减比例必须精确对应 1 折(`CacheRatio 0.1`)。 ### 7. Probe-07: Seed Determinism (固定随机种子复现性) * **检测对象**:OpenAI 系列 * **检测机制**:设置相同的 `seed` 和 `temperature=0`,在 5 分钟内发起 10 次重复查询。 * **通过准则**:输出内容必须实现 100% 字符级严格一致,保障科研实验的可复现性。 ### 8. Probe-08: Zero-Buffer SSE Stream (流式零缓冲推送) * **检测对象**:全部流式接口 (`stream=true`) * **检测机制**:客户端以毫秒级时间戳记录每一个 SSE `data: {}` 块的到达间隔。 * **通过准则**:Token 到达时间方差必须符合原厂生成节奏,严禁网关积攒 50~100 个 Token 批量刷新的伪流式行为。 ### 9. Probe-09: 600s Keep-Alive Connection (长任务超长保活) * **检测对象**:全系推理与代码生成 * **检测机制**:让模型执行超长论文排版或大项目代码生成,持续生成时间超过 180 秒。 * **通过准则**:TCP 连接在 600 秒内不得被任何中间反向代理掐断,保持长连接心跳。 ### 10. Probe-10: 50ms Auto-Failover (智能熔断切流时延) * **检测对象**:网关调度层 * **检测机制**:主动注入上游 429 / 503 异常,监测备用企业级通道接管耗时。 * **通过准则**:熔断切换时延必须在 50ms 内完成,客户端无感,无任何连接断开或错误透传。 ### 11. Probe-11: Raw Upstream Debug Headers (官方原生调试头透传) * **检测对象**:全部响应头 * **检测机制**:审查返回的 HTTP Headers,核验 `x-request-id`、`openai-processing-ms`、`anthropic-ratelimit-requests-remaining` 等。 * **通过准则**:原厂特有调试头必须完整可查,排除中间自制伪造层。 ### 12. Probe-12: Anti-Web-Reverse Detection (零逆向网页接口特征) * **检测对象**:全系接口 * **检测机制**:监测响应延迟、CF 盾特征、Session 轮询特征及非标准字段。 * **通过准则**:100% 排除任何使用网页版 (ChatGPT Web / Claude Web) 逆向偷跑的行为,必须为商业级原生 API 协议直连。 ### 13. Probe-13: Multimodal Binary Stream (多模态原始无损直传) * **检测对象**:Vision 及多模态接口 * **检测机制**:传入高分辨率学术图表(300 DPI 显微图 / 复杂热图),验证模型对微小坐标的识别准确率。 * **通过准则**:网关不得在转发时二次压缩、降低分辨率或损失图片色彩通道。 --- ## 三、 实时检测状态矩阵 (MODELOC Live Matrix) | 模型标识 | 对应原厂旗舰 | 当前检测状态 | 思考链完整性 | 缓存击中实测 | 最近探测时间 (UTC+8) | | :--- | :--- | :--- | :--- | :--- | :--- | | `gpt-6-astra` | OpenAI GPT-6 Astra | **PASSED** (13/13) | 支持 (Reasoning) | 1 折命中正常 | 2026-09-09 02:40:12 | | `gpt-5.6-sol` | OpenAI GPT-5.6 Sol | **PASSED** (13/13) | 支持 (Reasoning) | 1 折命中正常 | 2026-09-09 02:41:05 | | `claude-sonnet-5` | Anthropic Claude Sonnet 5 | **PASSED** (13/13) | 完整透传 (``) | 1 折命中正常 | 2026-09-09 02:43:01 | | `gemini-3.8-flash` | Google Gemini 3.8 Flash | **PASSED** (13/13) | 原生 `/v1beta/` 直传 | 官方标准缓存 | 2026-09-09 02:43:40 | | `deepseek-r1` | DeepSeek-R1 671B 原厂 | **PASSED** (13/13) | 完整透传 (`reasoning_content`) | 支持 | 2026-09-09 02:44:11 | > 📌 **声明 (Disclaimer)**:MODELOC 为第三方模型一致性检测,检测结果不代表 OpenAI、Anthropic、Google 或其他 Provider 官方的直接授权或许可。平台不主动修改上游 API 返回结构,实际 reasoning / thinking 内容及其可见性由上游 Provider、模型版本及客户端请求参数共同决定。 --- ## 四、 独立验证与反馈通道 * **公开探测地址**:[https://api.lmxxz.xyz/ai-docs/transparency.md](https://api.lmxxz.xyz/ai-docs/transparency.md) * **用户真机自测脚本**:[https://api.lmxxz.xyz/ai-docs/verify_gateway.py](https://api.lmxxz.xyz/ai-docs/verify_gateway.py) * **异常举报与核查信箱**:`audit@lmxxz.xyz`