• 繁體(T)简体(S)正常(N)
  • 申请任务 银行[存取转账] AFF时间积分兑换 统计排行 帮助
    • 25阅读
    • 0回复

    [游戏资讯][240718]七款AI大模型“高考成绩” 前三名文科过一本

    级别: Lv.3
    发帖
    2901
    MB
    32
    MD
    81
    本月打卡
    17
    活跃度
    34
    YQBD
    0
    国库券
    944
    https://www.3dmgame.com/news/202407/3899874.html

    [font=&quot]
    IT之家7月18日消息,上海人工智能实验室17日公布了针对7个AI大模型的高考全科目测试结果,据大模型开源开放评测体系“司南”相关负责人介绍,“当前大模型仍存在很大的局限性。组织AI大模型‘参加高考’,目的是评测当前大模型的真实水平,找准问题,持续推进技术进步。”
    测试结果显示,书生・浦语2.0系列文曲星大模型(浦语文曲星)、阿里通义千问大模型Qwen2-72B以及GPT-4o再次包揽文、理科前三甲;前三名 AI“考生”的文、理科成绩分别超过了“一本”“二本”线(以今年高考人数最多的河南省的分数线为参考)。
    从官方提供的图片来看,此次参与“高考”的大模型还包括来自零一万物的 Yi-1.5-34B、来自通义千问的 Qwen2-57B、来自智谱的GLM-4-9B 和法国 AI 初创公司Mistral旗下的Mixtral 8×22B。
    据介绍,此次评测具备如下特征:
    全卷考试:进行全卷评分,而不只针对单一题型,且包括带图的高考题
    考前开源:评测覆盖的开源模型均为今年高考前开源的模型,排除泄题的可能性
    老师打分:邀请有高考阅卷经验的老师打分,确保评分和高考尽量一致
    完全公开:生成答案的代码、模型答卷、评分结果完全开源
    在增加综合科目的基础上,Qwen2-72B、GPT-4o、浦语文曲星包揽文、理科前三甲。阿里通义千问大模型Qwen2-72B以546分的成绩荣获AI高考“文科状元”,浦语文曲星则以 468.5分成为理科第一名,分别超过了“非开源国际插班生”GPT-4o(文科531分,理科467分)。同为国外机构发布的Mixtral 8x22B平均得分最少,弱于国内大模型的高考表现。
    阅卷老师们一致认为,大模型与真人考生仍存在差距,虽然对于基础知识的掌握表现出色,但在逻辑推理和知识灵活应用方面,大模型仍然差强人意。具体而言,在作答主观题时,大模型往往无法完整理解题干,不明白代词指向,结果导致答非所问;解答数学题时,解题过程机械且逻辑性差,对于几何题,常出现与空间逻辑相违背的推断;对物理、化学实验理解肤浅,无法准确识别并运用实验器材。
    此外,大模型也会伪造虚构内容,编造看似合理但实际不存在的诗句,或在存在明显计算错误的情况下之后不反思,“硬着头皮蒙”一个答案,均给阅卷老师带来了困扰。
    根据上海人工智能实验室上个月公布的AI高考全卷结果,Qwen2-72B、GPT-4o及书生・浦语2.0文曲星(InternLM2-20B-WQX)成为本次大模型高考的前三甲,得分率均超过70%。大部分模型“考生”语文、英语科目表现良好,但数学方面仍有很大提升空间。




    描述
    快速回复

    您目前还是游客,请 登录注册
    如果您在写长篇帖子又不马上发表,建议存为草稿
    认证码: