Mengapa furigana dalam aplikasi anda tidak kelihatan seperti buku Jepun
Ramai pelajar bahasa Jepun mula mengenali furigana dengan menganggapnya sekadar bacaan kana yang diletakkan di atas kanji. Anggapan itu tidak salah, tetapi mudah menimbulkan kekeliruan.
Bagi ayat yang sama, 昨日、学校へ行った。, satu alat automatik mungkin menghasilkan 昨日、学校へ行った。. Buku kanak-kanak, buku teks atau penerbitan yang ditaip dengan teliti pula mungkin memilih 昨日、学校へ行った。.
Kedua-duanya membantu anda membaca bahasa Jepun, tetapi menjawab soalan yang berbeza. Cara pertama bertanya: bagaimanakah bunyi ayat ini? Cara kedua bertanya: bagaimanakah pembaca patut mengenali kanji yang tercetak?
Anggap ruby sebagai dua keputusan berasingan
Dalam tipografi bahasa Jepun, furigana biasanya dibincangkan sebagai ruby. Dalam tulisan mendatar, ruby lazimnya diletakkan di atas teks dasar; dalam tulisan menegak, ruby biasanya berada di sebelah kanan. W3C turut menyatakan bahawa saiz ruby secara lalai sering kira-kira separuh daripada saiz teks dasar. [1]
Namun, memilih teks yang menerima ruby dan menentukan cara ruby dilekatkan ialah dua keputusan yang berbeza. Adakah semua kanji memerlukan bantuan, atau hanya kanji sukar? Patutkah bacaan dilekatkan pada satu kanji, setiap kanji dalam kata majmuk atau seluruh perkataan?
JLREQ menerangkan tiga hubungan penting: mono-ruby, jukugo-ruby dan group-ruby. Mono-ruby memadankan satu aksara dasar dengan satu rentetan ruby. Jukugo-ruby mengekalkan kata majmuk sebagai satu unit sambil memelihara hubungan antara kanji dan bahagian bacaannya. Group-ruby memadankan beberapa aksara dasar dengan satu rentetan ruby. [2]
Pendekatan pertama: morfologi
Pendekatan morfologi bermula dengan analisis bahasa. Ia membahagikan ayat kepada perkataan atau morfem, kemudian menetapkan bacaan, golongan kata, lema dan maklumat perubahan bentuk.
Alat seperti MeCab memecahkan bahasa Jepun dan menghasilkan medan seperti bentuk permukaan, golongan kata, bentuk dasar, bacaan dan sebutan. UniDic juga direka khusus untuk analisis morfologi dan menggunakan unit pendek dengan lapisan seperti leksem, bentuk perkataan, bentuk tulisan dan bentuk sebutan. [3] [4]
Bagi 学校へ行った, pendekatan ini secara semula jadi menghasilkan 学校へ行った. Yang penting baginya ialah perkataan 学校 dibaca がっこう dan bentuk berubah 行った dibaca いった.
Pendekatan ini sangat baik untuk automasi. Aplikasi pembelajaran, sambungan pelayar, teks kepada pertuturan, indeks carian, kamus dan sistem NLP semuanya mendapat manfaat daripada bacaan perkataan yang memahami konteks. Ia boleh membezakan 生物 dalam konteks biologi daripada 生物 apabila merujuk kepada makanan mentah.
Titik buta: bacaan perkataan tidak semestinya sama dengan ruby bercetak
Bentuk perkataan 行った dibaca いった, tetapi ruby gaya penerbitan lazimnya menulis 行った. Bahagian った sudah kelihatan dalam teks dasar, jadi tidak perlu diletakkan di atas kanji.
Begitu juga, 学校 memadai untuk sebutan, tetapi konteks pembelajaran kanji mungkin memilih 学校. Di sini, がっ bukan bacaan tunggal がく; ia ialah bahagian bacaan yang menjadi milik 学 dalam kata majmuk selepas perubahan bunyi.
Bagi perkataan seperti 今日, 大人 dan 小豆, pemisahan aksara demi aksara tidak membantu. Sistem ortografi yang baik mengakui bahawa ini ialah bacaan berkumpulan.
Pendekatan kedua: ortografi atau berasaskan unit kanji
Pendekatan ortografi bermula daripada halaman bertulis. Di manakah kanji? Kata majmuk manakah yang mengandunginya? Aksara manakah memerlukan bantuan bagi pembaca sasaran? Jika ruby ditambah, patutkah ia menggunakan mono-ruby, jukugo-ruby atau group-ruby?
JLREQ turut membezakan ruby penuh, apabila semua kanji menerima ruby, dengan ruby separa, apabila hanya kanji terpilih menerimanya—kadangkala pada kemunculan pertama sahaja. [2] Inilah sebabnya bahasa Jepun bercetak kelihatan begitu terancang: ia menyokong sebutan sambil mengekalkan struktur perkataan bertulis.
Jukugo-ruby dan group-ruby
Jukugo-ruby ialah bentuk pertengahan yang mudah terlepas pandang. 学校 bukan sekadar dua anotasi ruby yang terpisah. Kata majmuk itu dibaca sebagai satu perkataan, tetapi setiap kanji masih menerima bahagian bacaan yang bermakna.
Group-ruby digunakan apabila bacaan perkataan tidak dapat diagihkan secara semula jadi: 今日, 明日, 大人 dan 一昨日. Kerangka Jōyō Kanji turut memperlakukan banyak bacaan ateji dan jukujikun sebagai bacaan pada peringkat perkataan dalam lampirannya; kerangka itu ialah panduan penulisan moden, bukannya senarai lengkap bagi setiap penggunaan. [5]
Perbezaan
| Dimensi | Pendekatan morfologi | Pendekatan ortografi atau unit kanji |
|---|---|---|
| Soalan utama | Bagaimanakah ayat atau perkataan ini dibaca? | Kanji bercetak yang manakah patut menerima bacaan tertentu? |
| Unit asas | Morfem, perkataan, unit pendek, bentuk berubah | Teks dasar, kanji, kata majmuk, seluruh perkataan |
| Hasil lazim | 学校, 行った | 学校, 行った |
| Kekuatan | Automasi, konteks, TTS, pembelajaran kosa kata | Kejelasan cetakan, pembelajaran kanji, buku teks, buku kanak-kanak |
| Kelemahan | Mungkin tidak menunjukkan kanji yang membawa setiap bunyi | Lebih sukar diautomatikkan dan sering memerlukan peraturan atau semakan |
Mengapa buku teks dan buku kanak-kanak memilih pendekatan tulisan
Buku-buku ini bukan sekadar membantu kanak-kanak menyebut teks; buku-buku ini juga mengajar kanji. Bahan sekolah Jepun menetapkan kanji mengikut tahun persekolahan, manakala bahan rasmi menerangkan pengagihan bacaan merentas peringkat sekolah berdasarkan perkembangan, beban pembelajaran, penggunaan harian dan pemahaman makna. [6] [7]
Oleh itu, 学校 mungkin memadai untuk membaca dengan lantang, tetapi 学校 lebih baik untuk mengajar hubungan antara kata majmuk bertulis dengan bunyinya. 行った memadai untuk sebutan, tetapi 行った lebih jelas menunjukkan cara kanji dan okurigana berfungsi bersama.
Empat contoh
学校. Morfologi: 学校. Ortografi: 学校. Yang pertama sesuai untuk kosa kata; yang kedua sesuai untuk kanji dan bacaan gaya penerbitan.
行った. Morfologi: 行った. Ortografi: 行った. Okurigana kekal kelihatan dalam teks dasar.
今日. Kedua-dua pendekatan sering menghasilkan 今日, kerana memaksa pembahagian 今日 akan mengajar gerak hati yang salah.
生物. Konteks amat penting. 生物を研究する biasanya dibaca 生物; 生物を冷蔵庫に入れる pula dibaca 生物. Sistem berasaskan tulisan mungkin memaparkan 生物 bagi bacaan pertama, tetapi mengekalkan 生物 sebagai bacaan berkumpulan bagi bacaan kedua.
Yang manakah lebih baik?
Jika anda hanya perlu membaca ayat dengan lancar, pendekatan morfologi adalah langsung dan berguna. Jika anda mempelajari kanji, membaca buku kanak-kanak, meneliti teks dengan rapat atau menyediakan bahan pengajaran, pendekatan ortografi lebih setia kepada halaman bercetak.
Pengajaran terbaik sering menggunakan kedua-dua lapisan: ajar kosa kata sebagai 学校 = がっこう, ajar bacaan sebagai 学校, dan terangkan bahawa 今日 ialah bacaan seluruh perkataan.
Untuk aplikasi dan alat pembelajaran: gunakan gabungan dua peringkat
Sistem furigana berkualiti tinggi patut menggunakan analisis morfologi terlebih dahulu untuk mengetahui bacaan perkataan, kemudian menggunakan peraturan gaya penerbitan untuk menentukan cara bacaan itu dilekatkan semula pada aksara bercetak. Peringkat kedua yang sukar bukan lagi sekadar NLP; ia menggabungkan linguistik, pendidikan kanji, tipografi bahasa Jepun dan reka bentuk untuk pembaca.
Dua pasang cermin mata
Pendekatan morfologi ialah cermin mata pendengaran. Ia melihat bahasa Jepun sebagai aliran bunyi dan bertanya: bagaimanakah ayat ini patut disebut?
Pendekatan ortografi ialah cermin mata tulisan. Ia melihat kanji, kana, kata majmuk, baris dan susun atur, lalu bertanya: bagaimanakah halaman ini dapat membantu pembaca membaca serta mempelajari tulisan?
Nota OCAT. Dalam OCAT, buka Tetapan → Pilihan Eksperimen untuk memilih furigana ortografi atau berasaskan unit kanji, ataupun furigana morfologi. Mod ortografi digunakan secara lalai. OCAT mungkin antara satu-satunya aplikasi pembelajaran bahasa Jepun yang menyokong pendekatan gaya penerbitan ini.
