← 返回首页
续报 v2 · 评测结果
两套指标分层 · 118 例逐例可展开(输入 / 确定性 facts / 润色段 / 13 维 check / GLM-5.2 4 维 judge / anomaly)
L1 · CORRECTNESS FLOOR
正确性地板(确定性检查器)
待核验
冻结集回归
13 维检查器用于冻结集发布门禁;通过不等于未知分布泛化满分。mutation 检出
297 个有效篡改
(另有 411 个 N/A),并单列模型接受率与回退率。
模型润色
—
安全回退
—
三方交叉验证
9/9
L2 · LANGUAGE QUALITY
GLM-5.2 独立语言质量 judge
待核验
测量状态
先检查裁判输出无效率;超过 5% 时聚合值只作端点诊断,不作为质量 KPI。
模型润色
—
安全回退
—
anomaly 维度
—
诚实边界:
已知绕过已加入根因级守门与回归保护,生产 API 也已统一到同一流程;但冻结数据参与过修复,仍需全新人工留出集验证未知分布。
查看当前评测状态 →
生成方式
本轮 L2 采用的文本
全部方式
—
模型润色通过
—
安全模板回退
—
用例来源
118 例如何构成
全部用例
—
内部标准
—
客户脱敏事件
—
极端边界测试
—
仅看异常/低分
共
0
例
说明:“安全模板回退”是事实保护机制,不代表报告失败;“客户脱敏事件”指 100 个事件用例,不是 100 个客户。
数据:results/summary.json(L1 离线)+ results_judge/summary.json(L2 GLM judge)· 评测脚本 eval/evaluate.py + eval/llm_judge.py