Ученые НИУ ВШЭ создали новый корпус детской русской речи

Исследователи Центра языка и мозга НИУ ВШЭ представили RusLan-M — открытый мультимедийный корпус, который позволяет проследить развитие русской речи у детей от первых слов до появления сложных грамматических конструкций. В базе собраны около 41 часа видеозаписей и более 35 тысяч детских высказываний. Новый ресурс поможет ученым точнее изучать, как дети осваивают русский язык, а в перспективе — создавать более надежные инструменты для оценки речевого развития. Исследование опубликовано в журнале Language Resources and Evaluation.
Несмотря на широкое распространение русского языка, данные о его раннем освоении остаются ограниченными. Международная база детских речевых корпусов CHILDES объединяет сотни коллекций более чем по 40 языкам, однако славянские языки в ней представлены значительно слабее. На момент подготовки исследования для русского языка были доступны лишь два корпуса детской речи в CHILDES. Новый ресурс RusLan-M призван восполнить этот дефицит и предоставить исследователям подробные, стандартизированные и доступные данные о том, как дети осваивают русский язык.
Корпус основан на наблюдениях за двумя русскоязычными детьми — Тосей и Яшей. Исследователи Центра языка и мозга НИУ ВШЭ фиксировали развитие их речи в течение длительного времени, а не сравнивали детей разных возрастов в одной временной точке. В коллекцию вошли 288 записей: речь Тоси записывали в возрасте от 10 месяцев до 3 лет и 10 месяцев, Яши — от 1 года и 4 месяцев до 3 лет. Общая продолжительность видеозаписей составила 2454 минуты, или около 41 часа, а число детских высказываний достигло 35 386.
Все записи сопровождались транскрипциями в международном формате CHAT и были опубликованы на платформе TalkBank — международном ресурсе для хранения и анализа данных о речи. При публикации корпуса исследователи соблюдали требования к защите персональных данных и анонимизации персональной информации.
Особенность нового ресурса заключается в том, что он позволяет изучать речь детей в естественной среде. В отличие от лабораторных экспериментов или опросников родителей, видеозаписи фиксируют спонтанное общение ребенка с близкими людьми и повседневное языковое окружение. Это дает возможность одновременно анализировать не только то, что говорит ребенок, но и речевой контекст, в котором развивается язык.
Мария Дьячкова
«Нам было важно создать ресурс, который позволит увидеть развитие детской речи не как набор отдельных результатов тестирования, а как живой и непрерывный процесс. Благодаря лонгитюдным записям мы можем проследить, как постепенно меняется речь конкретного ребенка, какие грамматические конструкции появляются раньше, какие позже и как на развитие влияет языковое окружение. Для русского языка такие открытые и подробно размеченные данные особенно важны», — говорит Мария Дьячкова, стажер-исследователь Центра языка и мозга НИУ ВШЭ, один из авторов исследования.
Пилотные исследования показали, как данные RusLan-M можно использовать для анализа развития морфологии и синтаксиса во времени. Корпус позволяет отслеживать появление и усложнение конкретных языковых конструкций, сравнивать различные этапы развития речи и формулировать новые гипотезы о механизмах усвоения языка.
Валерия Лелик
По словам авторов, значение таких данных выходит за рамки фундаментальной лингвистики. «Корпусные показатели могут использоваться для разработки нормативных ориентиров речевого развития в разных возрастах. В будущем это может помочь специалистам точнее отличать индивидуальные особенности освоения языка от потенциальных трудностей, поскольку оценка будет опираться на данные о реальной спонтанной речи детей», — отмечает Валерия Лелик, стажер-исследователь Центра языка и мозга, один из авторов исследования.
Авторы подчеркивают, что новый корпус частично закрывает заметный дефицит открытых данных о развитии русского языка.
Светлана Дорофеева
«Дневниковые записи детской речи десятилетиями служили материалом для исследований в отечественной онтолингвистике. И все работающие в данной области специалисты знают, какой колоссальный труд необходим для создания корпусов детской речи. Но важно отметить, что подобных корпусу RusLan-M мультимодальных (включающих аудио, видео, тексты) корпусов детской речи с детальной лингвистической разметкой на русском языке ранее в открытом доступе не было. Теперь благодаря этой масштабной работе у научного сообщества появился этот ценнейший инструмент», — рассказывает руководитель проекта, старший научный сотрудник Центра языка и мозга НИУ ВШЭ Светлана Дорофеева.
Корпус создавался общими усилиями большой команды: родителей, лингвистов (ученых и студентов), программистов. В нем удалось объединить живой родительский опыт, научную экспертизу и передовые цифровые технологии.
Ольга Драгой
«В перспективе расширение подобных коллекций позволит сравнивать речевое развитие большего числа детей, выявлять возрастные закономерности и создавать более точные модели освоения языка», — считает один из авторов исследования, директор Центра языка и мозга НИУ ВШЭ Ольга Драгой.
RusLan-M также демонстрирует, как методы корпусной лингвистики могут превратить многолетние наблюдения за детской речью в ресурс для широкого круга исследований — от теоретической лингвистики до психологии и практической оценки речевого развития.

