Почему фуригана в приложении выглядит не так, как в японской книге

Морфологический и орфографический подходы: два способа расставлять японскую фуригану

Многие начинающие воспринимают фуригану просто как чтение каной, написанное над кандзи. Это не совсем неверно, но такое представление быстро приводит к путанице.

Одно и то же предложение 昨日、学校へ行った。 автоматический инструмент может оформить так: 昨日きのう学校がっこう行ったいった. А детская книга, учебник или тщательно свёрстанное издание, скорее всего, выберет вариант 昨日きのうがっこうった。.

Оба варианта помогают читать по-японски, но отвечают на разные вопросы. Первый: «Как звучит это предложение?» Второй: «Как читатель должен соотнести чтение с напечатанными кандзи?»

Руби требует двух отдельных решений

В японской типографике фуригану обычно рассматривают как руби-аннотацию. При горизонтальном письме она, как правило, располагается над основным текстом, а при вертикальном — справа от него. W3C также отмечает, что по умолчанию размер руби часто составляет примерно половину размера основного текста. [1]

Однако выбрать, какой текст снабжать руби, и решить, к чему именно прикреплять чтение, — две разные задачи. Нужна ли подсказка для каждого кандзи или только для сложных? Следует ли привязать чтение к одному знаку, к каждому кандзи в сложном слове или ко всему слову целиком?

JLREQ описывает три важных типа связи: моно-руби, дзюкуго-руби и групповую руби. Моно-руби связывает один знак основного текста с одной строкой чтения. Дзюкуго-руби сохраняет сложное слово как единое целое, но при этом отражает внутреннюю связь между каждым кандзи и его частью чтения. Групповая руби связывает несколько знаков основного текста с одной общей строкой чтения. [2]

Первый подход: морфологический

Морфологический подход начинается с анализа языка. Предложение разбивается на слова или морфемы, после чего для каждой единицы определяются чтение, часть речи, лемма и сведения о словоизменении.

Такие инструменты, как MeCab, сегментируют японский текст и возвращают исходную форму в тексте, часть речи, словарную форму, чтение и произношение. UniDic также специально создан для морфологического анализа и использует короткие единицы с несколькими уровнями описания: лексема, словоформа, письменная форма и форма произношения. [3] [4]

Для 学校へ行った этот подход естественным образом даёт 学校がっこう行ったいった. Важно, что слово 学校 читается как がっこう, а изменённая форма 行った — как いった.

Такой результат отлично поддаётся автоматизации. Контекстно-зависимые чтения нужны учебным приложениям, браузерным расширениям, синтезу речи, поисковым индексам, словарям и системам обработки естественного языка. Например, система различает 生物せいぶつ в контексте биологии и 生物なまもの, когда речь идёт о сырых продуктах.

Слепая зона: чтение слова не всегда совпадает с печатной руби

Форма 行った читается как いった, но в издательской вёрстке руби обычно выглядит как った. Окуригана った уже видна в основном тексте, поэтому повторять её над кандзи не нужно.

Точно так же 学校がっこう достаточно для передачи произношения, однако при изучении кандзи предпочтительнее がっこう. Здесь がっ — не изолированное чтение がく, а часть чтения, соответствующая знаку внутри сложного слова после фонетического изменения.

Для слов 今日きょう, 大人おとな и 小豆あずき честное разделение чтения по отдельным знакам не приносит пользы. Хорошая орфографическая система признаёт их групповыми чтениями.

Второй подход: орфографический, по отдельным кандзи

Орфографический подход начинается с напечатанной страницы. Где находятся кандзи? В какие сложные слова они входят? Каким знакам нужна подсказка для целевого читателя? Если добавлять руби, должна ли она быть моно-руби, дзюкуго-руби или групповой?

JLREQ также различает полную руби, когда чтение получают все кандзи, и частичную руби, когда размечаются только выбранные знаки — иногда лишь при первом появлении. [2] Именно поэтому фуригана в печатном японском выглядит столь продуманно: она помогает произнести слово и одновременно сохраняет структуру его письменной формы.

Дзюкуго-руби и групповая руби

Дзюкуго-руби — промежуточный вариант, о котором легко забыть. がっこう — не просто две независимые аннотации. Сложное слово читается как единое целое, но каждый кандзи всё же получает осмысленную часть чтения.

Групповая руби нужна, когда чтение невозможно естественно распределить по знакам: 今日きょう, 明日あした, 大人おとな, 一昨日おととい. В приложении к японскому перечню дзёё-кандзи многие чтения атэдзи и дзюкудзикун также рассматриваются на уровне целого слова. При этом сам перечень служит ориентиром для современной письменности, а не исчерпывающим списком всех употреблений. [5]

Сравнение подходов

КритерийМорфологический подходОрфографический подход
Главный вопросКак читается это предложение или слово?Какое чтение следует указать для каждого напечатанного кандзи?
Основная единицаМорфема, слово, короткая единица, изменённая формаОсновной текст, кандзи, сложное слово, слово целиком
Типичный результат学校がっこう, 行ったいったがっこう, った
Сильная сторонаАвтоматизация, контекст, синтез речи, изучение словНаглядная печатная форма, изучение кандзи, учебники и детские книги
ОграничениеНе всегда показывает, какой кандзи соответствует конкретному звукуСложнее автоматизировать; часто нужны правила или ручная проверка

Почему учебники и детские книги предпочитают письменный подход

Их задача — не только помочь ребёнку произнести текст, но и научить кандзи. В японской школе знаки распределены по классам, а официальные материалы объясняют, как чтения вводятся на разных ступенях с учётом развития ученика, учебной нагрузки, частоты употребления и понимания смысла. [6] [7]

Поэтому 学校がっこう достаточно для чтения вслух, но がっこう лучше показывает связь между написанием сложного слова и его звучанием. 行ったいった передаёт произношение, а った нагляднее демонстрирует совместную работу кандзи и окуриганы.

Четыре примера

学校. Морфологический вариант: 学校がっこう. Орфографический: がっこう. Первый удобен для изучения слова, второй — для освоения кандзи и чтения в книжном формате.

行った. Морфологический вариант: 行ったいった. Орфографический: った. Окуригана остаётся видимой в основном тексте.

今日. Оба подхода обычно дают 今日きょう, поскольку искусственное разделение きょ создало бы неверное представление о чтении.

生物. Здесь решает контекст. В 生物を研究する слово обычно читается как 生物せいぶつ, а в 生物を冷蔵庫に入れる — как 生物なまもの. Орфографическая система может разделить первое чтение на せいぶつ, но оставить второе 生物なまもの групповым.

Какой подход лучше?

Если нужно лишь бегло прочитать предложение вслух, морфологический подход прям и удобен. Если вы изучаете кандзи, читаете детские книги, подробно разбираете текст или создаёте учебные материалы, орфографический подход точнее передаёт устройство печатной страницы.

Лучшее обучение часто сочетает оба слоя: словарное соответствие 学校 = がっこう, книжное чтение がっこう и пояснение, что 今日きょう читается как единое слово.

Для приложений и учебных инструментов: двухэтапный гибрид

Качественная система фуриганы должна сначала с помощью морфологического анализа определить чтение слова, а затем по правилам издательской вёрстки решить, как прикрепить это чтение к напечатанным знакам. Сложный второй этап выходит за рамки обычной обработки естественного языка: он объединяет лингвистику, обучение кандзи, японскую типографику и проектирование интерфейса для читателя.

Две пары очков

Морфологический подход — это «слуховые очки». Он воспринимает японский как поток звуков и спрашивает: «Как произнести это предложение?»

Орфографический подход — это «письменные очки». Он видит кандзи, кану, сложные слова, строки и макет страницы и спрашивает: «Как помочь читателю прочитать и понять написание?»

Примечание OCAT. В OCAT откройте Настройки → Экспериментальные функции, чтобы выбрать орфографическую фуригану по отдельным кандзи или морфологическую фуригану. По умолчанию используется орфографический режим. OCAT — одно из немногих приложений для изучения японского, где доступен такой книжный способ разметки.

Источники

  1. W3C: правила упрощённого размещения японской руби
  2. W3C: требования к вёрстке японского текста (日本語組版処理の要件)
  3. MeCab: морфологический анализатор и анализатор частей речи
  4. Глоссарий UniDic
  5. Агентство по делам культуры Японии: перечень дзёё-кандзи (常用漢字表)
  6. Распределение кандзи по классам школы (学年別漢字配当表)
  7. Министерство образования Японии: распределение чтений он и кун по ступеням школы

OCAT

Учить целые предложения эффективнее, чем запоминать отдельные слова!

OCAT — приложение, которое помогает быстрее развивать разговорные навыки на разных языках: Японский, Китайский, Кантонский, Английский, Французский, Немецкий, Испанский, Корейский и Русский. Обучение строится на диалогах с ИИ.

Вы можете легко собирать естественные предложения с подсказками по произношению и аудио, создавая собственную Коллекцию повседневных выражений. Слушайте их снова и снова, тренируйте восприятие речи на слух и постепенно начинайте говорить свободнее и естественнее.

Учить целые предложения эффективнее, чем запоминать отдельные слова!

Название «OCAT» происходит от японского выражения «おしえてoshiete», которое означает «научи меня, пожалуйста».

Основные возможности