← 服务体验
北大人医应急 · 评测结果
工具模型 × 评测通路对比矩阵 · 每个用例的输入/过程/输出可展开查看
emergency
duty
实验批次:
第九批次 v8.2(正式 HTTP · 直驱/自由Agent · GLM/Qwen)
第九批次 v8.1(正式 HTTP · 直驱/编排 · GLM/Qwen)
第九批次 v8.1(阶段结果 · Qwen已完成 · GLM待测)
第八批次 v8.1(正式直驱 · GLM/Qwen · 自然续报)
第八批次 v8.1(阶段结果 · Emergency双模型 · Duty Qwen)
第八批次 v8.0(省略信息专项 · GLM clean)
第七批次 v7.1(优化版 · GLM 超时恢复)
第七批次 v7.0(泛化评测集 v2 · GLM 全量)
第六批次修复版(泛化评测集 v2 · GLM 分层快评)
第六批次(泛化评测集 v2 · GLM 全量)
第五批次(泛化评测集 v2 · GLM 抽测)
第四批次(多通话续报判定)
第三批次(真实记录·医疗校准消融)
第二批次(多轮对话)
第一批次(单轮对话)
工具模型:
配置对比总表
选择配置查看逐例详情: