← 返回首页

续报 v2 · 评测结果

两套指标分层 · 118 例逐例可展开(输入 / 确定性 facts / 润色段 / 13 维 check / GLM-5.2 4 维 judge / anomaly)

L1 · CORRECTNESS FLOOR

正确性地板(确定性检查器)

待核验
冻结集回归
13 维检查器用于冻结集发布门禁;通过不等于未知分布泛化满分。mutation 检出 297 个有效篡改(另有 411 个 N/A),并单列模型接受率与回退率。
模型润色 — 安全回退 — 三方交叉验证 9/9
L2 · LANGUAGE QUALITY

GLM-5.2 独立语言质量 judge

待核验
测量状态
先检查裁判输出无效率;超过 5% 时聚合值只作端点诊断,不作为质量 KPI。
模型润色 — 安全回退 — anomaly 维度 —
诚实边界:已知绕过已加入根因级守门与回归保护,生产 API 也已统一到同一流程;但冻结数据参与过修复,仍需全新人工留出集验证未知分布。查看当前评测状态 →
生成方式
本轮 L2 采用的文本
用例来源
118 例如何构成
共 0 例
说明:“安全模板回退”是事实保护机制,不代表报告失败;“客户脱敏事件”指 100 个事件用例,不是 100 个客户。
数据:results/summary.json(L1 离线)+ results_judge/summary.json(L2 GLM judge)· 评测脚本 eval/evaluate.py + eval/llm_judge.py