
图说:介入高考的偏科6个开源模型和GPT-4o的语数英下场 本源/上海人工智能考验考验室(下同)
高考已告一段落 ,一群“出格考生”最早出分!语文员说
本年高考甫一停止,分数上海推出的学都除夜模型开源开放评测琐细“司南”就拔取6个开源模型及GPT-4o举办高考“语数外”全卷身手测试。评测采取全国新课标I卷 ,不合介入评测的格群全数开源模型,开源时分均早于高考 ,生阅确保评测“闭卷”性。卷教同时,偏科下场由具有高考评卷经验的语文员说教员人工评判,愈加接近真实阅卷标准 。分数
下场若何样呢?学都“除夜模型高考”的前三甲得分率均超70% ,除夜部分模型“考生”语文、不合英语科目默示出色,格群但在数学方面另有很除夜的生阅汲引空间 。个中,月初开源的阿里通义千问除夜模型Qwen2-72B排名第一,在语数外三科420分的满分中掉落踪掉落踪303分 ,OpenAI的GPT-4o和上海人工智能考验考验室的骚人·浦语2.0文曲星(InternLM2-20B-WQX)排名二三位 。
除夜模型考生比拼新课标I卷
高考 ,如今已普及被研究者用于审核除夜模型的智能程度 。
司南评测琐细团队拔取了GPT-4o及在2024年高考前开源的6个模型 ,考生分袂是——
Mixtral 8x22B:法国AI创业公司Mistral于2024年4月17日开源的对话模型;
Yi-1.5-34B :零一万物公司于2024年5月12日开源的Yi-1.5系列最除夜的模型;
GLM-4-9B :智谱AI于2024年6月4日推出的最新一代预操练模型GLM-4系列的开源版本;
InternLM2-20B-WQX:上海人工智能考验考验室于2024年6月4日开源的骚人·浦语2.0系列文曲星除夜言语模型;
Qwen2-57B :阿里巴巴于2024年6月6日开源的Qwen2系列MoE对话模型;
Qwen2-72B :阿里巴巴于2024年6月6日开源的72B稀少模型;
司南评测琐细团队称 ,因没法断定闭源模型的更新时分 ,为公允起见,此次评测没有纳进商用闭源模型 ,仅引进GPT-4o作为评测参考。
司南评测琐细初度采取高考全卷测试的编制,拔取新课标I卷“语数外”三科问题问题作为测试集 。因受测的开源模型均为除夜言语模型 ,在评测过程中 ,仅输进文字题干(数学包含2道带图试题),英语听力部分(分值30分)不纳进此次评测。
首个除夜模型高考全卷评测下场展示,Qwen2-72B、GPT-4o及骚人·浦语2.0文曲星(InternLM2-20B-WQX)成为此次“除夜模型高考”的前三名 ,在总分420分的语数英三科斗劲中 ,三位“考生”的总分分袂是303分 、296分和295.5分。
言语身手“不错” 数学“一样往常”
司南评测琐细团队引见,除夜部分模型在“言语”本质上的默示出色,语文平均得分率为67% ,英语更是抵达了81%。
数学则是全数除夜模型的短板,平均得分率仅为36%。得益于研究团队在数学推理上的投进 ,InternLM2-20B-WQX掉落踪掉落踪了75分,在全数受测模型中排名第一——但仍未抵达合格程度 ,这注清除夜模型的数学身手存在较除夜汲引空间 。



介入评测的全数开源模型,权重均在2024年6月7日高考问题问题宣布前开源 ,阻拦了“数据净化”和“刷题”风险,与真实高考严格的“闭卷考验”齐截,不存在“作弊”大年夜大年夜约。
与以往多采取高考客不美不雅不雅不雅不雅不雅不雅题审核模型的编制不合,本次测试研究团队独霸了语数外三科的全卷试题 ,既包含选择 、填空等“谜底独一性”问题问题,也包含简答 、不雅不雅不雅不雅鉴赏邃晓及作文等主不美不雅不雅不雅不雅不雅不雅题 ,在愈加接近真实高考的气候中测试模型身手。
为切近高考评卷编制 ,连络团队聘请多位具有阅卷经验的高中教员对模型主不美不雅不雅不雅不雅不雅不雅题谜底评分,每份考卷起码由3位教员分袂打分。对不合答复但教员评分不合的气候 ,则会再次举办复核,尽大年夜大年夜约阻拦“争议判卷”的展示 。
连络团队认为 ,似乎高考阅卷也存在纤细不合,因为主不美不雅不雅不雅不雅不雅不雅题圭表类型的引进,本次评测也没法做到尽对的公允。但同时因为主不美不雅不雅不雅不雅不雅不雅题的存在,本次测评可以在真完成象中从人的视角审核除夜模型身手 ,为学术界和财富界供给更有价值的方针参考 。
阅卷前不晓得“考生”身份
本次阅卷采取与高考齐截的无缺匿名编制,全数除夜模型答卷均举办了匿名措置,阻拦阅卷教员产生发火“进步先辈为主”的不美不美定见 。在阅卷最早前 ,阅卷教员未被陈述答卷均由模型生成 ,使阅卷教员无缺以面对真实考生的标准评判答复终局 。
在完成全数除夜模型答卷的评卷工作后,阅卷教员被陈述所评“考生”的真实身份为除夜模型 。研究人员同时聘请各科教员对除夜模型默示举办了集团分化,为模型身手汲引计策供给参考 。
“语文阅卷组”认为:模型的现代文不雅不雅不雅不雅鉴赏邃晓身手普及较强 ,可是不合模型的白话文不雅不雅不雅不雅鉴赏邃晓身手差距较除夜 。除夜模型作文更像问答题,当然有针对性但窘蹙润饰,几近不存在人类考生都邑独霸举例论证、援引论证、名人名言和人物素材等手段 。
“数学阅卷组”指出:除夜模型的主不美不雅不雅不雅不雅不雅不雅题答复绝对混乱,且过程具无益诱性 ,甚至展示过程偏向但掉落踪掉落踪切确谜底的气候。除夜模型的公式记忆身手较强,可是没法在解题过程中矫捷独霸。
“英语阅卷组”展示 :集团默示出色,但部分模型因为不适应题型,在七选5、完形填空等题型得分率较低 。除夜模型英语作文普及存在因超出字数限制而扣分的气候,而人类考生多因为字数不足扣分。
司南评测琐细团队陈述记者 ,后续将在评测中引进多模态除夜模型,以审核模型应对更多题型的身手,并延续宣布袒护不合学科和区域的无缺高考评测 。
新平易近晚报记者 郜阳 金志刚
【相干不雅不雅不雅不雅鉴赏】除夜模型技能哪家强?上海人工智能考验考验室宣布开源开放评测琐细“司南”