Взгляд в будущее на «Китайской неделе»: Счётные слова и машинный перевод
10.07.2021
大家好!Прошлую публикацию мы закончили на моменте, где я обозначила масштабную проблему, связанную одновременно с лингвистикой и информационными технологиями, но сам корень зла я так и не указала. Исправлю эту оплошность сегодня.
Как я отмечала в разделе «Об авторе», ресурсов и научных знаний в мире для создания полноценной системы автоматизированного машинного перевода с русского на китайский и наоборот в целом достаточно. На мой взгляд, рисёрчерам из ИТ-гигантов зачастую не хватает комплексного понимания вопроса с учётом социокультурных факторов (а всё потому, что они никогда не изучали социокультурное регионоведение). Коллега из Белорусского государственного университета информатики и радиоэлектроники Цянь Лунвэй в статье «Онтологический подход к обработке текстов китайского языка» подробно перечисляет имеющиеся недостатки в машинной обработке китайских текстов, однако не уделяет внимания узким аспектам проблемы, таким, как некорректная обработка счётных слов. Цянь Лунвэй верно отмечает, что все современные системы обработки текстов китайского языка и его машинного перевода основаны на почти никак не изменённых системах обработки текстов европейских языков, однако почти не говорит о том, что наличие уникальных языковых явлений, таких, как вышеупомянутые счётные слова, исследователями учтено слабо. Подобное игнорирование особой лингвокультурологической специфики китайского языка как изолированного и не похожего ни на один другой язык приводит к фатальным ошибкам при переводе. Получается, что некачественные результаты машинного перевода являются следствием непонимания китайской культуры разработчиками, а фактическая неполноценность инструмента, связывающего русскую и китайскую культуры, в свою очередь, также делает вклад во взаимонепонимание культур, т.к. люди, не владеющие китайским языком, не могут полагаться на популярные сервисы в своей коммуникации с представителями китайской нации. Из этого следует, что использование социокультурного подхода в деятельности по построению систем машинного перевода оправданно и необходимо.
Цянь Лунвэй также выделяет среди современных методов обработки естественного языка следующие направления: – методы построения системы логических рассуждений на основе правил; – методы машинного обучения, основанные на математической статистике и теории информации. Как я уже упоминала, для перевода счётных слов сейчас в основном используется метод правил. Не так давно специалисты из Азиатского исследовательского центра компании Microsoft в Пекине в статье «Генерация счётных слов при переводе с английского языка на китайский в статистических системах машинного перевода» предложили альтернативный статистический вариант обработки, однако социокультурный подход подсказывает нам, что решение, справедливое для английского языка, не может быть имплементировано для русского языка в неизменном виде. Более того, данная статья не подкреплена исходным кодом модели машинного обучения, а значит, результаты работы Microsoft не могут быть взяты для модификации предложенного ими метода или верификации приведённых ими показателей точности.
Подобная ситуация тесно связана с системным парадоксом, затрагивающим все области современной науки и известным как кризис воспроизводимости (replication crisis). Данный термин означает, что великое множество имеющихся на данный момент научных изысканий невозможно повторить или воспроизвести. Между тем воспроизводимость исследований является одним из главных критериев научности. В той же сфере машинного обучения подавляющее большинство научных статей поставляется без какого бы то ни было исходного кода, следовательно, о том, насколько правдивы высокие показатели точности описываемых в статьях моделей, остаётся лишь догадываться. Если бы я стала реализовывать свои идеи и создавать свою модель машинного обучения для улучшения качества перевода счётных слов, я бы от начала и до конца работы над ней проводила политику максимальной открытости и прозрачности с возможностью верификации полученного мной опыта, доведения до моего сведения объективной критики или предложения более эффективного алгоритма достижения исследовательской цели. При распространении практического результата исполнения проекта, а именно искусственной нейронной сети, был бы использован принцип open-source (приложение с открытым исходным кодом); датасеты и исходный код работы должны были бы быть выложены на специализированную открытую интернет-площадку Github так, чтобы каждый энтузиаст мог с ними ознакомиться, скачать и попробовать самостоятельно обучить модель. Но, опять же, повторюсь, что всё это пока существует только в идеальном мире, выстроенном моим сознанием, и возьмусь я за это трудное и благородное дело или нет – большой вопрос. А вообще-то, классификация – это механизм, под который нейронные сети заточены невероятно хорошо. Можно и попробовать когда-нибудь.
Но что могло бы помочь исследователю сделать выбор в пользу того или иного метода (метода правил или же статистических методов)? Вспоминаем социокультурный и лингвокультурный подходы и приходим к выводу, что лучше самих китайцев об особенностях употребления счётных слов могут рассказать только процессы, происходящие у китайцев в этот момент на подкорке. Только представьте себе: нейросеть, созданная на основе психолингвистического эксперимента «с оглядкой» и «с поправкой» на характер процессов, происходящих при использовании языка его реальными носителями!
Такие крупные учёные, как Д.Г. Выговская, Н.В. Уфимцева и Е.Ф. Тарасов, полагают, что экспериментом можно считать только то, что предполагает креативную свободу выбора, предоставление сигнала в ответ на стимул. В связи с этим эксперимент мне видится довольно простым и в то же время заставляющим задуматься. Главный вопрос тестирования будто бы слизан с шуточных тестов на шизофрению, призывающих читателя выяснить, что общего у двух несовместимых между собой предметов. Это будет анкетирование с открытым ответом, призванное выяснить, действительно ли мозги китайцев заточены на классификацию всего и вся или же они просто берут счётные слова из внутренней «базы данных» и сопоставляют их с лексемами, на мой взгляд, может выглядеть довольно просто. Тестирование может быть проведено через автоматизированную веб-систему, записывающую две главных метрики в исследовании – скорость и точность ответов испытуемых. Опросник, содержащий пары классифицируемых слов для испытуемых носителей русского и китайского языка, должен быть составлен независимо для каждого из двух языков с учётом привычного для них словоупотребления. Вопросы должны быть расставлены по возрастанию сложности ответа, начиная с самых очевидных по общности пар и заканчивая теми, где сходство не так очевидно.
При условии получения результатов, позволяющих определить, что носители китайского языка действительно ежедневно в процессе общения проводят операцию классификации, в основу нейросетевого модуля мог бы быть положен именно этот принцип, и простая модель может быть расширена на основе статистических методов. Если же эксперимент покажет, что носители китайского языка справляются с задачами классификации не лучше носителей русского и при общении обращаются к некоторой когнитивной «базе данных», где каждой известной им лексической единице однозначно поставлены в соответствие счётные слова с учётом контекста, то, возможно, использование статистического метода представляется нецелесообразным, и достаточно эффективно может сработать привычный для современной обработки естественного языка метод правил, имеющий в своей основе приблизительно схожий принцип работы.
Мечтайте, верьте и исследуйте неизведанное, и до встречи в следующую субботу!