Preview

Труды Института системного программирования РАН

Расширенный поиск

Гибридный подход к оценке эссе без обучения на целевом корпусе с помощью LLM-агентов на основе рубрик и детерминированных лингвистических признаков

https://doi.org/10.15514/ISPRAS-2026-38(4)-30

Аннотация

Системы автоматической оценки эссе требуют размеченных данных для каждого нового корпуса. В данной работе исследуется, можно ли снизить эту зависимость за счёт объединения двух парадигм: агентов на основе больших языковых моделей (БЯМ), оценивающих эссе без обучения на целевых данных, и детерминированных лингвистических признаков, описывающих лексику, морфологию и синтаксис независимо от рубрики. На эталонном наборе ASAP 2.0 (17 307 эссе, шкала 1-6) гибридный регрессор на основе случайного леса достигает квадратично взвешенной каппы (QWK) = 0,765 на полном корпусе, приближаясь к лучшим результатам методов обучения с учителем (0,841). Признаки в отдельности дают 0,719 без нейросетей. Жадный ансамбль из 15 агентов набирает QWK = 0,650 без обучения. Рубрики, согласованные с целевой популяцией, значимо превосходят межпопуляционные, подтверждая ведущую роль построения рубрик. Результаты формализованы как «спектр переносимости оценки»: детерминированные признаки переносимы наиболее надёжно, за ними следуют рубрики для целевой популяции и межпопуляционные рубрики.

Об авторах

Тендаи Мапунгвана ЧИКАКЕ
Центр прикладных лингвистических исследований и тестирования, Московский физико-технический институт
Россия

Младший научный сотрудник Центра прикладных лингвистических исследований и тестирования «ИСТОК» МФТИ. Область научных интересов: автоматическая оценка текстов, обработка естественного языка, агентные системы на основе больших языковых моделей, псевдобулевы полиномы.



Андрей Алексеевич МИХАЙЛОВ
Центр прикладных лингвистических исследований и тестирования, Московский физико-технический институт
Россия

Сотрудник Центра прикладных лингвистических исследований и тестирования «ИСТОК» МФТИ. Область научных интересов: машинное обучение, обработка естественного языка, автоматическая оценка текстов.



Список литературы

1. Page E.B. The Imminence of Grading Essays by Computer. Phi Delta Kappan, 1966, vol. 47, no. 5, pp. 238-243.

2. Attali Y., Burstein J. Automated Essay Scoring With e-rater V.2. Journal of Technology, Learning, and Assessment, 2006, vol. 4, no. 3.

3. Shermis M.D., Burstein J. Automated Essay Scoring: A Cross-Disciplinary Perspective. Lawrence Erlbaum Associates, Mahwah, NJ, 2003.

4. Devlin J., Chang M., Lee K., Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, 2019, pp. 4171-4186.

5. Amin T., Tanoli Z., Aadil F., Awan K.M., Lim S. Enhancing Essay Scoring: An Analytical and Holistic Approach with Few-Shot Transformer-Based Models. IEEE Access, 2025, vol. 13. DOI: 10.1109/ACCESS.2025.3530272.

6. Mizumoto A., Eguchi M. Exploring the Potential of Using an AI Language Model for Automated Essay Scoring. Research Methods in Applied Linguistics, 2023, vol. 2, no. 2, pp. 100050. DOI: 10.1016/j.rmal.2023.100050.

7. Lee G., Latif E., Wu X., Liu N., Zhai X. Applying Large Language Models and Chain-of-Thought for Automatic Scoring. Computers and Education: Artificial Intelligence, 2024, vol. 6, pp. 100213. DOI: 10.1016/j.caeai.2024.100213.

8. Jarvis S. Short Texts, Best-Fitting Curves and New Measures of Lexical Diversity. Language Testing, 2002, vol. 19, no. 1, pp. 57-84. DOI: 10.1191/0265532202lt220oa.

9. Coxhead A. A New Academic Word List. TESOL Quarterly, 2000, vol. 34, no. 2, pp. 213-238. DOI: 10.2307/3587951.

10. Lu X. Automatic Analysis of Syntactic Complexity in Second Language Writing. International Journal of Corpus Linguistics, 2010, vol. 15, no. 4, pp. 474-496. DOI: 10.1075/ijcl.15.4.02lu.

11. Kyle K., Crossley S.A. Measuring Syntactic Complexity in L2 Writing Using Fine-Grained Clausal and Phrasal Indices. Modern Language Journal, 2018, vol. 102, no. 2, pp. 333-349. DOI: 10.1111/modl.12468.

12. Crossley S.A. Linguistic Features in Writing Quality and Development: An Overview. Journal of Writing Research, 2020, vol. 11, no. 3, pp. 415-443. DOI: 10.17239/jowr-2020.11.03.01.

13. Crossley S.A., Baffour P., Tian Y., Holden L., Betts A. A Large-Scale Corpus for Assessing Source-Based Writing Quality: ASAP 2.0. Assessing Writing, 2025, vol. 63, pp. 100912. DOI: 10.1016/j.asw.2025.100912.

14. Crossley S., Baffour P., King J., Burleigh L., Reade W., Demkin M. Learning Agency Lab – Automated Essay Scoring 2.0, 2024. Available at: https://kaggle.com/competitions/learning-agency-lab-automated-essay-scoring-2, accessed 01.06.2026.

15. Learning Agency Lab. Learning Agency Lab – Automated Essay Scoring 2.0: Competition Results, 2024. Available at: https://kaggle.com/competitions/learning-agency-lab-automated-essay-scoring-2/leaderboard, accessed 01.06.2026.

16. Do H., Kim Y., Lee G.G. Prompt- and Trait Relation-aware Cross-prompt Essay Trait Scoring. Findings of the Association for Computational Linguistics: ACL 2023, 2023, pp. 1538-1551.

17. Qwen Team. Qwen3, 2025. Available at: https://qwenlm.github.io/blog/qwen3/, accessed 01.06.2026.

18. Chikake T.M., Bazanova E.M., Gorizontova A.V. Multi-tier linguistic feature engineering for CEFR classification: a comprehensive analysis of deterministic and machine learning-based features. Modeling and Analysis of Information Systems, 2026, vol. 33, no. 1, pp. 6-29. DOI: 10.18255/1818-1015-2026-1-6-29.

19. Geertzen J., Alexopoulou T., Korhonen A. Automatic Linguistic Annotation of Large Scale L2 Databases: The EF-Cambridge Open Language Database (EFCAMDAT). Proceedings of the 31st Second Language Research Forum, 2013, pp. 240-254.

20. Council of Europe. CEFR Companion Volume with New Descriptors. Council of Europe Publishing, Strasbourg, 2020.

21. British Council, IDP, Cambridge Assessment English. IELTS Writing Band Descriptors (Task 2). 2023. Available at: https://www.ielts.org, accessed 21.04.2026.

22. Educational Testing Service. TOEFL iBT Writing Rubrics. 2024. https://www.ets.org/toefl, accessed 21.04.2026.

23. Cambridge Assessment English. Cambridge English Writing Assessment: Teacher Guides, 2024.

24. Available at: https://github.com/deeppavlov/istok-platform, accessed 27.06.2026.

25. Breiman L. Random Forests. Machine Learning, 2001, vol. 45, no. 1, pp. 5-32. DOI: 10.1023/A:1010933404324.

26. Cohen J. Weighted kappa: Nominal scale agreement provision for scaled disagreement or partial credit. Psychological Bulletin, 1968, vol. 70, no. 4, pp. 213-220. DOI: 10.1037/h0026256.


Рецензия

Для цитирования:


ЧИКАКЕ Т., МИХАЙЛОВ А.А. Гибридный подход к оценке эссе без обучения на целевом корпусе с помощью LLM-агентов на основе рубрик и детерминированных лингвистических признаков. Труды Института системного программирования РАН. 2026;38(4):257-266. https://doi.org/10.15514/ISPRAS-2026-38(4)-30

For citation:


CHIKAKE T., MIHAILOV A.A. A Hybrid Approach to Zero-Shot Cross-Corpus Essay Scoring via Rubric-Prompted LLM Agents and Deterministic Linguistic Features. Proceedings of the Institute for System Programming of the RAS (Proceedings of ISP RAS). 2026;38(4):257-266. https://doi.org/10.15514/ISPRAS-2026-38(4)-30



Creative Commons License
Контент доступен под лицензией Creative Commons Attribution 4.0 License.


ISSN 2079-8156 (Print)
ISSN 2220-6426 (Online)