🏥 医疗垂类大模型 Benchmark v6.0

融合 8 大国际评测基准 · 12 维度加权评分

📅 更新于 2026-06-27 60 题 12 模型 8 基准
全部 第一梯队 第二梯队 第三梯队 第四梯队
排名 模型 厂商 类型 加权总分 诊断 急危 用药 报告 抗幻觉 API

梯队分布

能力分布

X轴: Y轴: 气泡:
选择模型(最多4个)

能力雷达图

维度对比表

模型详情

12 维度全景表

60 题样例

搜索: 按维度筛选:

加权评分公式

S= Σ (wi × di)

其中 wi 为第 i 个维度的权重,di 为该维度的得分(0-5),总分 S ∈ [0, 5]

常见问题 FAQ

1配置
2执行
3分析

📋 测试配置

🗳️ 裁判面板配置

选择 2-3 个裁判(使用同一模型不同 temperature 模拟独立裁判)
Judge Strict
Temperature: 0.05 (严格)
Judge Normal
Temperature: 0.1 (标准)
Judge Lenient
Temperature: 0.3 (宽松)

🎭 盲评模式

模型回答将匿名化为 Model A / Model B,人工专家可对每条回答直接打分
🔄
检测到未完成的测试
加载中...
加载中...
📝 题目管理
💾 数据管理
🔑 API配置
题库方案 题目·可视化
📋 题库方案
📈 可视化对比
题库方案 60题 × 12维度
题库设计融合8大Benchmark方法论,覆盖从单轮知识到长程工作流的完整能力谱系

🩺 AI问诊

暂无问诊记录
{{ task.title || '未命名问诊' }}
{{ getModelName(task.model) }}
🩺

AI医疗问诊助手

专业医疗咨询,遵循循证医学原则
点击下方快捷入口,或点击「新建问诊」开始对话

{{ msg.role === 'assistant' ? '🩺' : '👤' }}
{{ formatTime(msg.timestamp) }}
🩺
{{ streamingContent }}
⚠️ AI回复仅供参考,不构成医疗诊断或治疗建议

新建问诊

系统提示词

⚠️ 确认操作

请输入下方文字以确认操作:
⚕️

AI 问诊服务声明

  • 本服务由 AI 提供,不能替代专业医生的诊断和治疗
  • AI 回复仅供参考,不构成医疗诊断或治疗建议
  • 如有紧急症状(剧烈胸痛/呼吸困难/大量出血/意识障碍),请立即拨打 120
  • 用药建议仅为通用名参考,请遵医嘱使用
  • 您的对话数据仅存储在本地服务器,不会上传至第三方