自动作文评分(AES)是一种计算方法,用于评估书面散文,通常是学生作文,而无需人工直接阅读。AES系统利用统计模型、自然语言处理以及日益增多的机器学习技术来分析文本,并为语法正确性、连贯性和论证力度等维度分配分数。该方法自20世纪90年代末起已投入商业应用,现已整合到大规模标准化考试和在线学习平台中,与人工评分员相比,它提供了速度、一致性和成本效益。
AES通过从作文中提取特征来运作,例如句子长度、词汇多样性、句法复杂性和话语标记的存在,然后使用预测模型将这些特征映射到分数。早期系统依赖手工规则和回归,而现代实现则使用深度学习架构,包括神经网络模型和基于Transformer的大型语言模型,以捕捉写作中更微妙的模式。该领域与人工智能在自然语言理解和自动反馈方面的研究相交汇,并引发了关于基于机器的评估的有效性、公平性和教育影响的持续辩论。
历史发展
自动作文评分的概念出现于20世纪60年代,但实用系统直到20世纪90年代才出现。第一个广泛使用的商业系统,即作文评分项目(PEG),由埃利斯·巴顿·佩奇于1966年开发,但数十年来仍处于实验阶段。1999年,教育考试服务中心(ETS)推出了e-rater,该系统结合统计和语言特征来为研究生入学考试(GRE)和其他考试中的作文评分。大约在同一时间,基于潜在语义分析的智能作文评估器(IEA)由培生公司部署在知识分析技术平台上。这些早期系统依赖特征工程和线性模型,与人工评分员实现了中等程度的一致性。
到2010年代,机器学习的兴起和大型标注作文语料库的可用性使得更复杂的方法成为可能。2012年休利特基金会的自动学生评估奖(ASAP)竞赛提供了一个公开基准,推动了集成方法和特征丰富模型的研究。2017年Transformer架构的引入,特别是BERT及后来的大型语言模型,标志着一个转折点,使AES系统能够上下文地处理整篇作文,而不仅仅依赖手工特征。截至2020年代中期,许多商业系统,包括大学理事会和各种州级评估所使用的系统,都融入了神经模型,但将机器评分与人工审查相结合的混合方法仍然常见。
技术方法
AES系统通常遵循预处理、特征提取和评分的流水线。预处理包括分词、词性标注和句法分析,通常使用计算语言学工具。特征提取可分为表面级特征(如词数、句子长度)、句法特征(如解析树深度、从句密度)、语义特征(如主题连贯性、词汇重叠)和话语特征(如主题句存在、过渡词)。传统模型,如支持向量机或线性回归,将这些特征组合成单一分数。
现代AES日益依赖深度学习和神经网络模型,尤其是基于Transformer的架构。这些模型可以直接从原始词元中学习文本表示,捕捉长距离依赖和细微的风格模式。例如,模型可能使用预训练的大型语言模型作为骨干,在作文评分数据集上进行微调,并带有输出连续分数的回归头。一些系统采用多头注意力机制来权衡作文的不同部分,而其他系统则使用序列到序列或编码器-解码器框架来处理更复杂的任务,如反馈生成。训练通常涉及对人类评分作文进行监督学习,损失函数如均方误差或序数回归损失。有时会应用数据增强和课程学习等技术来提高鲁棒性,而模型剪枝可以降低部署的计算成本。
应用与部署
AES用于多种高风险和低风险场景。在标准化考试中,教育考试服务中心(ETS)在GRE和托福考试中使用e-rater,而大学理事会则使用AES系统用于SAT作文(2021年停用,但仍在一些州级评估中使用)。培生公司的智能作文评估器用于K-12和高等教育写作项目,而Turnitin的修订助手和Grammarly的语气和风格检查等平台也融入了类似AES的功能。在大型开放在线课程(MOOC)中,AES使得数千名学生的可扩展评分成为可能,如Coursera的同伴互评作业辅以自动检查。
在测试之外,AES驱动自动反馈工具,帮助学生修改写作。这些系统可以标记语法错误、建议组织结构改进并提供整体分数。一些研究原型使用强化学习或基于AI反馈的强化学习来生成更具指导性的评论。然而,部署并非没有争议。批评者认为,AES可能被冗长或表面复杂的语言所欺骗,并且可能惩罚创造性或非标准写作风格。研究表明,人工评分员和AES在修辞复杂性较高的作文上经常存在分歧,这引发了对非母语者和不同背景学生公平性的担忧。
评估与挑战
AES系统通常通过衡量与人工分数的一致性来评估,使用二次加权卡帕系数(QWK)或皮尔逊相关系数等指标。ASAP基准设定了QWK高于0.80的目标,许多现代系统已超过该目标。然而,在平均上实现高一致性并不能保证对个别作文的准确性,尤其是离群值。挑战包括处理离题作文、检测对抗性输入(例如,能欺骗模型的胡言乱语)以及考虑文化和语言差异。研究还探讨了AES中的偏见,发现如果训练数据不具有代表性,模型可能系统性地低估某些人口群体作文的分数。
另一个挑战是神经模型的可解释性。虽然基于特征的系统可以通过列出贡献特征来解释分数,但深度学习模型通常是黑箱。这导致了可解释AES的研究,使用注意力可视化或模型剪枝等技术来识别显著词汇。截至2020年代初,没有AES系统能完全复制训练有素的人工评分员的判断,大多数专家建议在高风险决策中将AES作为人工评估的补充而非替代。
未来方向
将大型语言模型整合到AES中是一个活跃的研究领域。像GPT-4和Claude这样的模型可以生成详细反馈,甚至通过少样本提示进行评分,尽管其可靠性和一致性仍在研究中。一些研究者提出使用生成式人工智能来创建合成训练数据,以解决标注作文稀缺的问题。其他人则探索多任务学习,即单一模型同时执行评分、反馈和抄袭检测。OpenAI和Anthropic模型的发展也引发了关于AES应基于通用语言模型还是专用评分系统的疑问。
政策和伦理考量可能会塑造未来的采用。关于算法问责、数据隐私和自动化在教育中的作用的辩论仍在进行。一些教育机构已转向完全自动化评分,转而采用人机协同系统,其中AES提供初步评分,人工评分员审查边缘案例。截至2020年代中期,该领域的共识是AES将继续发展,但其成功将取决于解决公平性、透明度和反馈的教学价值问题。
参见
- 机器学习
- 大型语言模型
- Transformer
- 教育考试服务中心
- 自然语言处理