Детальная информация

Серкова, Алина Игоревна. Определение уровня сложности немецкоязычных текстов по шкале CEFR с помощью модели BERT = Assessment of German-language text difficulty within the CEFR framework using a BERT model: выпускная квалификационная работа бакалавра: направление 45.03.02 «Лингвистика: лингвистика» / А. И. Серкова; научный руководитель О. Ю. Савина; Тюменский государственный университет, Институт социально-гуманитарных наук. — Тюмень, 2026. — 1 файл (1,1 Мб). — Загл. с титул. экрана. — Доступ по паролю из сети Интернет (чтение). — Adobe Acrobat Reader 7.0. — <URL:https://library.utmn.ru/dl/Module_VKR_Tyumen/ISiGN/2026/vr26-2232.pdf>. — Текст: электронный

Дата создания записи: 17.09.2026

Тематика: обработка естественного языка; сложность текста; машинное обучение; большая языковая модель BERT; шкала CEFR; natural language processing; text difficulty; machine learning; BERT large language model; CEFR scale

Коллекции: Выпускные квалификационные работы

Разрешенные действия:

Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов

Группа: Анонимные пользователи

Сеть: Интернет

Аннотация

В работе рассматривается применение технологий машинного обучения для автоматической оценки сложности немецкоязычных текстов по шкале CEFR – задача, актуальная для отбора учебных материалов, поскольку традиционная экспертная оценка трудоёмка и субъективна. Исследование включает формирование референтного корпуса объёмом 1256 текстов, размеченных по уровням от A2 до C2, и разработку алгоритма на основе большой языковой модели BERT. В ходе совершенствования алгоритма были добавлены 19 лингвистических признаков, а также применено ансамблирование BERT с классическими моделями машинного обучения. Установлено, что для немецкого языка наиболее значимыми оказались синтаксические признаки – сложные синтаксические конструкции, пассивный залог и сослагательное наклонение. Максимальная точность алгоритма составила 60%, что сопоставимо с результатами аналогичных исследований на других языках. Разработанный алгоритм может использоваться в рамках образовательного процесса для оценки и отбора материалов для чтения релевантного уровня сложности.

This study examines the application of machine learning technologies for the automatic assessment of the difficulty of German-language texts according to the CEFR scale — a task that is relevant for selecting educational materials, as traditional expert evaluation is labor-intensive and subjective. The research includes the creation of a reference corpus of 1,256 texts annotated with levels from A2 to C2, as well as the development of an algorithm based on the large language model BERT. During the refinement of the algorithm, 19 linguistic features were added, and an ensemble approach combining BERT with classical machine learning models was applied. It was found that for the German language, syntactic features – such as complex syntactic structures, passive voice, and the subjunctive mood – proved to be the most significant. The maximum accuracy of the algorithm reached 60%, which is comparable to results reported in similar studies for other languages. The developed algorithm can be employed within the educational process for assessing and selecting reading materials of an appropriate complexity level.

Права на использование объекта хранения

Место доступа Группа пользователей Действие
ТюмГУ Все
Интернет Читатели
-> Интернет Анонимные пользователи

Статистика использования

stat Количество обращений: 0
За последние 30 дней: 0
Подробная статистика