English
联系我们
网站地图
邮箱
旧版回顾



经典传奇

卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业_我的网站

神偷奶爸3

A |      8 月 24 日消息,据外媒 Phys.org 今天(24 日)报道,卡迪夫大学和墨尔本大学的一项新研究发现,生成式人工智能(GenAI)目前还无法像人类教师一样可靠地评判学生的书面作业。研究人员使用 ChatGPT 的两个版本,对 50 篇生物科学专业本科生论文进行评分,以测试大模型评估学生作业的能力。ChatGPT 需要按照 7 项标准批改这些论文,研究人员还采用了 4 种不同的提示方式,随后将大模型与人工评分的平均分和分数波动情况进行比较。图源:Pexels卡迪夫大学生物科学学院威廉 · 凯博士指出:“研究结果显示,模型给出的分数波动很大,无法准确预测人工评分。生成式 AI 与人类批改同一批论文时存在明显差异。只看论文总分,两者给出的结果相对接近;一旦具体到每项评分标准和每一篇论文,大模型与人工评分之间的差距就相当明显。    近日,随着GTA 6新一轮泄露视频持续传播,有海外博主从多支驾驶视频中发现了关于通缉系统的关键细节。”除一种情况外,AI 模型给出的平均分普遍高于人工评分。

B | 据分析,几乎所有涉及高速驾驶的泄露片段中,主角都处于被通缉状态,这与前作中警察"金鱼记忆"式的追捕逻辑形成鲜明对比。

C | 平均分方面,AI 模型与人工评分的最大差距达到 16.1 分;具体到单篇论文,最大差距达到 40 分。    从泄露画面来看,GTA 6的通缉系统引入了多项新机制。首先,交通摄像头和监控系统扮演了重要角色,超速或违反交通规则可能直接被摄像头记录并触发通缉,而非仅仅依赖现场目击的警察。其次,警察似乎拥有"持久记忆"——即便玩家暂时甩掉追捕,通缉状态也不会像前作那样在数十秒内自动消失,而是会持续追踪玩家的身份和车辆信息。获悉,威廉 · 凯还发现,AI 往往会压低高分论文的成绩,又把低分作业的成绩抬高,最终使分数系统性地向中间集中。为彻底消除通缉,玩家需要采取更复杂的规避手段,包括佩戴面罩遮挡面部、更换服装改变外观、以及更换交通工具等。研究结果说明,至少现阶段,即使经过大量训练,AI 仍无法可靠地对主观性较强的书面作业给出与人类相当的分数。此外,泄露内容还暗示游戏中的路人角色现在可以主动举报犯罪行为,进一步增加了街头犯罪被发现的概率。“我们测试的大模型目前并不适合取代教师,为学生预测作业成绩。    本文由游民星空制作发布,未经允许禁止转载。

D | ”研究人员指出,高等教育领域确实很关注大模型能否利用模式识别能力,让学生作业评分更加客观,同时提高批改效率、减轻教职人员压力。

E | 更多相关资讯请关注:GTA6专区。但这项研究表明,目前并不适合这么做。此外,未经学生明确同意便把作业提交给 AI 工具,本身还涉及伦理问题;大模型也不能、也不应该被依赖来给学生的长篇书面作业评分。

F | “随着大模型继续发展,未来模仿人类判断的能力可能会提高。但从这项研究来看,要让 AI 给出的分数与人工评分真正保持一致,恐怕并不容易。

Current article:http://v85wkt.cuozubeishenjingli.cfd/news/20260826_111.html

Published on:06:24:53


专题推荐

相关新闻


© 1996 - 我的网站 版权所有   联系我们

地址:北京市三里河路52号 邮编:100864