# 续报评测状态与泛化边界

> 当前核验日期：2026-08-30。本文是评测口径的当前真源；旧报告中的数值仅代表各自历史快照。

## 当前可确认的结果

| 证据 | 当前结果 | 能说明什么 | 不能说明什么 |
|---|---:|---|---|
| 118 例冻结集回归 | 全部通过；最近一次真实模型运行 110 例，安全回退 8 例 | 当前改动没有破坏已知事实、结构和异常处理约束 | 不是未知分布上的泛化率，也不是模型质量满分 |
| mutation | 297 个有效篡改均被检出；411 个不适用变异记 N/A | 检查器能检出已定义的结构与事实破坏 | 不能穷尽自然语言攻击或未来业务口径 |
| 事实守门组合测试 | 覆盖普通数字、未分科、截至时间、导语地点/事件的否定与未知修饰，以及含“不/无”的真实科室实体 | 未识别修饰默认失败关闭，避免依赖有限否定词表 | 合法但未声明的新句式可能触发回退，这是有意的安全取舍 |
| golden 认证 | 9 个对抗用例使用落盘绑定哈希；其余 109 例在消费时由生产实现、既有 golden、独立算法实时交叉核验 | 防止认证失效被静默记 N/A 后仍显示全通过 | 客户 golden 与独立算法同源，只属于 derived 跨实现回归，不是人工独立真值 |
| 版本快照 | 17 项端到端校验通过，另有碰撞/损坏/缺号/读副作用回归测试 | 已知版本链与恢复边界正常 | 不等价于分布式存储或跨主机并发验证 |
| L2 语言质量 | 118/118 例完成；1401 轮无效 0；冻结集自动评审均分 0.9841 | 单字符评审协议在本轮完整可测，可作内部冻结集自动评审参考 | 未经人工校准，不是外部泛化率、人工质量结论或“100%” |

冻结集通过率只作为发布门禁展示，不再称“泛化指标”或“质量满分”。当前真实模型接受率为
`110/118`（93.22%），回退率为 `8/118`（6.78%）；两者允许随模型采样波动，用于观察守门是否过严，不和正确性检查合成单一总分。

## L2 语言质量状态

旧 JSON 协议下，GLM 自建端点会在完整 `{"score": ...}` 后继续输出 `</arg_value>`、
`</think>` 或数字碎片并以 `finish_reason=abort` 结束，造成 504/1086（46.41%）无效轮次。
重试在真实并发压力下仍有大量污染且显著放大尾延迟，根因不在报告文本，也不应靠宽松解析恢复。

当前协议改为只返回 `A/B/C`（分别映射 1.0/0.5/0.0），`max_tokens=1`，并继续要求整段严格等于
一个标签。最新全量结果为：

- 执行完整性：118/118 例完成，失败 0；
- 测量可靠性：1401 轮无效 0、恢复 0，`measurementQuality.status=valid`；
- 冻结集自动评审均分：`0.9841`；
- 分维度：通顺度 `1.0000`（n=118）、公文语体 `0.9915`（n=118）、信息完整 `0.9425`
  （n=113）、洁净度 `1.0000`（n=118）；另 5 例因源数据契约矛盾在信息完整维度记 N/A；
- 判别力探针：干净文本四维均为 1.0，故意加入重复、占位符和错数字的污染文本四维均为 0.0。

旧 `0.5159` 只保留作端点协议故障的历史快照，已被本轮取代。这里的
`measurementQuality.scoreReportable=true` 仅表示传输、解析和执行完整性达到展示门槛；
`0.9841` 仍只是**内部冻结集上的自动评审参考**。冻结样本已参与修复，自动 judge 尚未与人工
盲评做一致性校准，因此不能对外解释为泛化率、人工语言质量结论或“100%”。

## 泛化验收还需要什么

真正的泛化结论需要一批修复过程未见的新数据，至少按时间、地区、事件类型和异常组合分层，
并冻结人工标注后一次性评测。建议分别报告：

1. 事实误接收率：错误/否定/未知陈述被放行的比例；
2. 合法文本接受率与回退率：守门安全性和可用性分开看；
3. 事实字段逐项准确率及置信区间，不用一个总分掩盖稀有错误；
4. 人工盲评语言质量，并同时报告裁判一致性和无效响应率；
5. 按分层切片给出最差组表现，而非只给微平均。

在取得上述外部留出集前，当前结论限定为：已知回归与生成式守门探针通过，生产 API 已与
生成器共用同一守门流程；未知分布泛化仍待外部留出集验证。
