Взгляд в будущее на «Китайской неделе»: Счётные слова в китайском языке
3.07.2021
大家好!认识你们很高兴。Сегодня мы с вами стоим на пороге знаменательного события – даём старт работе культурно-просветительского интернет-издания «Китайская неделя - 中国星其» и открываем серию из двух, пожалуй, наиболее серьёзных публикаций среди тех, что когда-либо появятся на данном ресурсе. Оба поста напрямую связаны с информацией, указанной мной в разделе «Об авторе» и раскрывают тему машинного перевода китайских счётных слов, а также сравнения способностей к классификации у носителей китайского и русского языка. Неизвестно, когда мои руки дойдут до проведения полноценного исследования и дойдут ли вообще, так что читайте и внимайте, пока я добрая и не боюсь делиться со всем миром своими идеями. :)
Для начала я расскажу о том, что представляют собой счётные слова и какую роль это явление играет в китайском языке, а во второй публикации озвучу ряд мыслей о том, каким образом можно было бы организовать реальную исследовательскую деятельность с практическим выхлопом.
Приступим к рассмотрению такого уникального явления в языке обитателей Поднебесной, как «счётные слова». Счётные слова (量词, liàngcí, лянцы) — это особые служебные слова, которые, по всей видимости, произошли от единиц измерения в условиях отсутствия в языке иной возможности различить множественное и единственное число. Они употребляются, когда нам необходимо назвать предмет в единичном количестве или указать точное количество – в данной ситуации между числительным и предметом нужно поставить специальное слово, указывающее на понятийную категорию, к которой принадлежит предмет. Наличие таких слов – специфическая отличительная черта китайского языка, однако похожие особенности ещё можно наблюдать в японском и корейском. Здесь вы имеете полное право мне возразить: «У нас в русском такое тоже есть, вот сами посмотрите! Две бутылки лимонада, пять головок чеснока, восемь коробок памперсов, и так до бесконечности…»
Ответом на ваше возражение послужит статья «On the Semantic Distinction between Classifiers and Measure Words in Chinese» за авторством One-Soon Her и Chen-Tien Hsieh из Национального университета Чжэнчжи (National Chengchi University) на Тайване. Вслед за авторами статьи мы выделяем в составе счётных слов две категории: классификаторы и измерительные слова (в русской же синологии термином «счётные слова» чаще всего принято разделять классификаторы). Если измерительные слова – это как раз явление, так или иначе существующее в любом языке, в том числе и в русском (что вы и продемонстрировали своим недоуменным вопросом), то классификаторы как раз являются уникальными для китайского. Они никак не переводятся на русский и по сути не несут смысловой нагрузки.
Такие словосочетания, как 一条狗 (Yītiáo gǒu, одна собака – букв. «один – счётное слово для длинных предметов - собака»), 三台电脑 (Sān tái diànnǎo, три компьютера – букв. «три – счётное слово для техники - компьютер»), 九件衬衫 (Jiǔ jiàn chènshān, девять рубашек – букв. «девять – счётное слово для одежды - рубашка») представляют собой яркий пример классификаторов, которые являются непереводимыми показателями принадлежности к определённому классу предметов. Примером выражения с измерительным словом можно считать фразу 两瓶可口可乐 (Liǎng píng kěkǒukělè, две бутылки кока-колы) – такое в русском тоже есть.
Главная загвоздка при машинном и человеческом переводе с русского на китайский заключается в том, что переводчику или системе фактически неоткуда брать классификаторы – в русском их не существует, а в китайском они словно материализуются из воздуха, будучи порой нелогичными для носителя российского менталитета (например, мне самой до сих пор не очень понятно, почему собаку китайцы относят к категории длинных предметов – вроде таксы у них не так уж широко распространены…). И если человек может справиться с этим, просто заучивая счётные слова вместе с новыми для себя лексическими единицами, то вот системам машинного перевода в этом плане приходится туго. Гораздо проще с измерительными словами – но всё становится веселее, когда контекст русского предложения позволяет их опустить (мы можем по-русски неформально сказать продавцу: «Дайте, пожалуйста, 2 кока-колы», но по-китайски мы всё равно скажем 请给我两瓶可口可乐 - «дайте мне 2 бутылки кока-колы». Здесь типичное измерительное слово с абсолютно нормальной смысловой нагрузкой и переводимостью ведёт себя как слово-классификатор – то есть не переводится на русский, а потому не может быть обнаружено многими существующими системами перевода).
Конечно, можно однозначно сопоставлять слово и использующееся для него счётное слово, как это и делают в основном все текущие системы перевода (об этом во второй части), но в огромном количестве контекстов это теряет смысл. Как я, так и мои иностранные коллеги замечают, что в контексте «В моей семье 5 человек» китайцы используют классификатор «口 (букв. рот)» для существительного «人 (человек)», а в более распространённых контекстах используется «个 (более-менее универсальное счётное слово)». С точки зрения «китайской логики» вполне нормально то, что используется не универсальный классификатор «个», а вполне специфичный «рот», ведь члены семьи – это рты, которых я обязан кормить. Однако Яндекс-переводчик просто-напросто игнорирует контекст и в любой понятной и непонятной ситуации применяет к слову 人 счётное слово 个 (проверено неоднократно; Гугл-переводчик справляется получше). Если слово «семья» (家) вообще явно не указано в исходном предложении, вероятность правильного подбора счётного слова стремится к нулю, ибо в этом случае системы машинного перевода работают, основываясь на строго заложенных правилах однозначного соответствия счётных слов. Решение проблемы в настоящее время хоть как-нибудь разработано только для английского языка (именно поэтому Гугл-переводчик справляется лучше – он в большинстве случаев производит промежуточный перевод с русского на английский, а с английского на китайский), но нам хотелось бы видеть качественные переводы с поправкой на русский язык и его специфику. И это я ещё ничего не упомянула о том, что для этого самого «человека» счётных слов существует вовсе не два, а где-то с пяток…
В связи со всем вышесказанным мне в голову закралась интересная мысль: если у китайцев в языке всё настолько хорошо категоризировано, что даже системы автоматизированного перевода теряют голову, почему это не может давать им природного бонуса к скиллу распределения всего и вся по классам в реальной жизни? Ведь есть же знаменитая лингвистическая гипотеза Сепира – Уорфа о том, что язык определяет мышление – можно было бы разузнать, верна ли она для данного конкретного случая, а заодно и приоткрыть завесу тайны над тем, как китайцы умудряются правильно это всё употреблять. Может быть, выявленные особенности мышления жителей Поднебесной применимы для повышения качества машинного перевода? Ответа на этот вопрос я пока не знаю и дать не могу, но у меня есть по этому поводу кое-какие соображения, которыми я поделюсь с вами в следующую субботу. До встречи!