• 发文
  • 评论
  • 微博
  • 空间
  • 微信

SuperCLUE最新评测:山海通用能力跻身国内大模型Top10,长文本能力位列全国三甲

云知声 2024-05-06 11:40 发布于北京 发文

4月30日,国内权威大模型评测机构SuperCLUE发布《中文大模型基准测评2024年度4月报告》,报告选取国内外具有代表性的32个大模型在4月份的版本,通过多维度综合性测评,真实反映大模型通用能力。报告显示,云知声山海大模型在4月评测中取得总分69.51的优异成绩,跻身国内大模型Top10;与GPT-4的对战中,山海综合胜率与和率为75.55%,超越MiniMax、讯飞星火等大模型。

SuperCLUE作为国内权威通用大模型综合性测评基准,其前身可追溯至第三方中文语言理解评估基准CLUEThe Chinese Language Understanding Evaluation)。自2019年成立以来,CLUE基准一直致力于提供科学、客观、中立的语言模型评测,其先后推出了CLUEFewCLUEKgCLUEDataCLUE等多个被广泛认可的评估标准。根据CLUE多年测评经验,SuperCLUE基于通用大模型在学术、产业与用户侧的广泛应用,构建了多层次、多维度的综合性测评基准。

作为一个完全独立的第三方评测机构,SuperCLUE采用自动化评测技术,有效消除人为因素带来的不确定性,确保提供无偏倚的客观评测结果。为确保与真实用户体验一致,SuperCLUE纳入了开放主观问题的测评,通过多维度多视角多层次的评测体系以及对话的形式,真实模拟大模型应用场景,真实有效考察模型生成能力。同时,通过构建多轮对话场景,更深层次考察大模型在真实多轮对话场景的应用效果,对大模型的上下文、记忆、对话能力全方位评测。 

本次评测题目为多轮开放式简答题,评测集共2194题,涵盖计算、逻辑推理、代码、工具使用、知识百科、语言理解、长文本、角色扮演、生成与创作、安全十大基础任务。

评测数据显示,云知声山海大模型总分为69.51,跻身国内大模型Top10。值得一提的,在具有产业落地意义的长文本能力上,山海大模型取得了68.2分的优异成绩,位列全球大模型第四、国内大模型第三。

此外,为真实反应通用大模型与产业应用之间的差距,引导大模型提升技术落地效果,在通用能力基础上更好进行垂直领域的应用,SuperCLUE基于基础能力和应用能力两个维度,构建了大模型四个象限,分别代表潜力探索者、技术领跑者、实用主义者、卓越领导者,以此区分大模型所处的不同阶段与定位。象限图显示,山海大模型被归类为实用主义者,这意味着其在场景应用上处于领先地位。

自山海大模型发布以来,云知声一边保持大模型能力高速迭代,一边不断探索大模型场景落地应用。

在大模型能力提升上,目前山海大模型通用能力持续演进,于3OpenCompass大模型评测中排名全球大模型厂商第六、国产大模型厂商第四,多项能力超越GPT-4, 跻身通用大模型第一梯队;医疗专业能力在20236月的MedQA任务中超越Med-PaLM 2,取得87.1%的优异成绩,在临床执业医师资格考试中得分523(总分600分),超过99%的考生水平,并在MedBench评测中以综合得分54.7的优异成绩登顶榜首,其基于山海大模型孵化的医疗大模型也在CCKS 2023 PromptCBLUE医疗大模型评测中夺得通用赛道一等奖。

在大模型场景落地探索上,云知声基于过往实践经验,将山海大模型应用于熟悉的医疗、座舱、交通等行业场景——在医疗领域,云知声基于山海大模型打造的门诊病历生成系统已落地北京友谊医院,有效提升了病历撰写效率与质量;在政务领域,云知声率先开发出深圳首个政务大模型“龙知政”,全场景赋能提升政府治理水平;在座舱领域,云知声通过山海大模型赋能吉利睿蓝汽车打造情感型虚拟助手,为用户带来全车全场景的情感化智能交互体验;在交通领域,云知声山海大模型“入驻”南宁火车东站,打造更具人性化的智能客服,为乘客带来更快捷、更便利的出行体验,相关案例也于近期被央视《焦点访谈》栏目报道。

随着技术进步和应用场景拓展,大模型市场竞争将更加激烈,也将进一步推动技术创新和产业升级。作为大模型赛道的积极参与者与创新者,未来云知声将持续深耕大模型技术创新与研发,增强大模型实用性、适应性,通过与行业伙伴紧密合作,共同推动大模型技术向更高水平发展,为产业升级和经济增长注入新的动力。

 

声明:本文为OFweek维科号作者发布,不代表OFweek维科号立场。如有侵权或其他问题,请及时联系我们举报。
2
评论

评论

    相关阅读

    暂无数据

    云知声

    云知声智能科技股份有限公司官方账...

    举报文章问题

    ×
    • 营销广告
    • 重复、旧闻
    • 格式问题
    • 低俗
    • 标题夸张
    • 与事实不符
    • 疑似抄袭
    • 我有话要说
    确定 取消

    举报评论问题

    ×
    • 淫秽色情
    • 营销广告
    • 恶意攻击谩骂
    • 我要吐槽
    确定 取消

    用户登录×

    请输入用户名/手机/邮箱

    请输入密码