?
Faroese Corpus Development: Strategies for Low-Resource Languages Corpora
В статье описывается разработка морфологически размеченного корпуса для фарерского языка – мало -
ресурсного германского языка. Описывается создание большого корпуса современных новостных текстов с
автоматической разметкой, выполненной с помощью специально обученной модели SpaCy. Мы демонстри-
312
руем эффективность создания лингвистических ресурсов для малоресурсных языков при минимальном ко-
личестве начальных данных. На основе небольшого, но качественно размеченного набора данных OFT была
обучена морфологическая модель на базе архитектуры Transformer с использованием кросс-валидации, что
позволило достичь высокой точности в морфологической разметке и лемматизации. Ручная оценка подтвер-
ждает удовлетворительное качество автоматической разметки, хотя остаются определенные трудности в
различении омонимичных словоформ, относящихся к разным частям речи. Данное исследование предлагает
методологическую основу для разработки лингвистических ресурсов для других малоресурсных языков при
минимальных требованиях к количеству начальных данных