2. えいごを はなさない 人が、もじを つくった
2. 英語を話さない人が、自分たちの文字を作った
2. シクォイアのチェロキー音節文字 ── 1音節に1文字を当てる設計
むかし、アメリカに シクォイアと いう 人が いました。チェロキーの 人で、えいごは はなさず、チェロキーの ことばだけを はなして いたそうです[2]。
シクォイアは、1821ねんに、あたらしい もじを つくりました。ひとつの もじが、ひとつの おとを あらわします。ぜんぶで 85こ くらいです[2][3]。
この もじは、チェロキーの 人たちの あいだで、あっと いう まに ひろまりました[2]。しんぶんにも つかわれました。
たとえば「か」「き」のように、おとを ひとつずつ あらわす もじを ならべる しくみです。ただし ほんとうは、ひらがなと おなじ ではなく、ぜんぶ ちがう すがたの もじです。
1音節に1文字という考え方
シクォイアは英語を話さず、チェロキー語だけを話した人と伝えられています[2]。その人が1821年に完成させたのが、チェロキー音節文字です。1つの文字が1つの音節を表す、という作りでした[3]。
音節とは、日本語でいえば「か」「き」のような、ひとかたまりの音のことです。文字の数は資料によって84〜86字と幅があり、約85字と考えておけば十分です[2]。
広まり、新聞に載る
この文字は、多くのチェロキーの人たちに速く受け入れられました[2]。ニューエコータ(いまのジョージア州)では、1828年から1834年にかけて、音節文字を使った記事を載せた新聞『チェロキー・フェニックス』が印刷されました。英語との2言語でした[2]。
ところが、文字を作る道は、いつも使えるわけではありません。ふつうは、すでにある文字を借りる道のほうが近道になります。次は、ローマ字で語りを書きとめた本を見ます。
シクォイアは英語を話さず、チェロキー語だけを話したとされる[2]。その彼の音節文字が1821年に公表された。それが「Cherokee Agayuh」、すなわち音節文字で、各文字が1つの音節を表す設計だ[3]。文字数は出典で84〜86字と幅があり、約85字として扱うのが安全である[2]。
この設計の利点は、音を単位にするため、習得の手がかりが明快なことだろう。実際、この文字は多くのチェロキーの人々の間で急速に採用された[2]。NLMのNative Voicesは、同化政策が強まる状況で言語を保つ助けになったと述べている[3]。
実用の場もできた。新聞『チェロキー・フェニックス』は1828〜1834年にニューエコータで、記事の一部を音節文字で印刷した(英語との2言語)[2]。ただし、音節文字を新たに設計する方法は、設計者と使い手の共同体がそろった一例であり、どの言語にも当てはまる手段とは限らない。
では、すでにある文字を使うと何が起きるのか。次は、ローマ字でアイヌ語の語りを書いた例を見る。
3. かたりを、ローマじで かいた 本
3. アイヌ語の語りを、ローマ字で書いた『アイヌ神謡集』
3. 『アイヌ神謡集』(1923)── ローマ字表記と日本語の対訳という形式
つぎは、日本の おはなしです。アイヌの 人たちには、かみさまの おはなしを かたる ならわしが ありました。
これを ローマじで かいた 本が、1923ねんに できました。『アイヌ しんようしゅう』と いいます[4]。ひだりの ページに アイヌごを、みぎの ページに 日本ごを かいて、ならべました。
かいたのは、ちり ゆきえ さんです。おばあさんが かたりての 人で、アイヌごと 日本ごの りょうほうが わかる 立ばでした[5]。
ローマじなら、かたりの おとを、かなりの ところまで うつせます。ただし ほんとうは、こえの ちょうしや ふしまわしまでは、のこりません。
13編の語りを、左と右に並べる
『アイヌ神謡集』は1923年に郷土研究社から出た本です。神謡13編と序を、ローマ字で書いたアイヌ語で収め、金田一京助が後書きを書いています。ページは左がアイヌ語、右が日本語で、ほぼ対訳の形です[4]。
書いたのは知里幸恵です。幸恵の祖母は、神謡の語り手だったと紹介されています。幸恵はアイヌ語と日本語の両方が分かる立場にいました[5]。
ローマ字で書くよさと、残らないもの
ローマ字で書けば、語りの音の並びを、文字に写しとれます。左右に日本語が並ぶので、アイヌ語を知らない読者にも、中身が届きます。
ただ、文字にしても、声の高さや間合い、語りの調子までは書き残せません。そのため、声そのものを録音して残す仕事が、あとから必要になっていきます。
『アイヌ神謡集』は1923年に郷土研究社から刊行された。ローマ字表記のアイヌ語による神謡13編と序、金田一京助の後書きからなり、左にアイヌ語、右に日本語を置くほぼ対訳の形式をとる[4]。
編者の知里幸恵は、祖母が神謡の語り手で、自身はアイヌ語と日本語の両方を理解できる立場にあったと紹介される[5]。口承を文字に移すには、語りを聞き取れることと、書き手が読者の側の言語も知っていることの両方が要るわけだ。
ローマ字を選ぶ利点は、文字の体系を新たに作らずに、語りの音を写せることだ。一方、限界は、声の高さ・間合い・調子といった口承の要素が文字に残りにくいことにある。ここから、声そのものを残す録音と、その保存の仕事が重みをもつ。
では、録音を残す仕事は、いつ、どんな考えから広がったのか。
4. こえを ろくおんして、のこす
4. 声を録音して残す ── 言語ドキュメンテーションと保存の拠点
4. 言語ドキュメンテーションの発想と、ELAR・PARADISECの役割
ろくおんを あつめて ながく のこす という かんがえかたが、1990ねんだいに ひろがりました[6]。
ロンドンの SOASと いう 大学には、ろくおんを あつめる ばしょが あります。2004ねんに できて[7]、そのなかみの 6わりほどが、こえの ろくおんです。
オーストラリアにも、おなじ しごとの ばしょが あります。1000を こえる ことばの きろくを もって います[8]。
あとで別の目的にも使える一次データを残す
言語ドキュメンテーション(記録言語学)は、1990年代に分野として発展した考え方です。ねらいは、文法の説明などの分析結果よりも、あとで別の目的にも使える録音や映像などの一次データを、長く残すことです[6]。
録音を預かる場所
ロンドン大学SOASの消滅危機言語アーカイブELARは、2004年1月に作られました。2009年時点で50件を超える寄託があり、約4テラバイトを保管していて、そのおよそ6割が音声録音でした[7]。カセットテープやオープンリールのデジタル化も手伝います[7]。
オーストラリアのPARADISECは、2003年に言語学者と音楽学者が始めました。山のように残っていた録音資料をデジタル化するための専門のアーカイブで、千を超える言語の記録を持つとされます[8]。
ところが、録音を集めて保管しても、それだけでは使いにくいままです。次は、日本の例で、集めた声を探せる形にする仕事を見ます。
言語ドキュメンテーションは、1990年代に分野として発展した。分析結果より、再利用できる一次データ(録音・映像など)を長期の記録として残すことに主眼がある[6]。
この方針を支える保存の拠点がある。ELARは2004年1月にSOASで設立され、2009年の時点で50件超の寄託と約4TBを保管し、約6割が音声録音だった。カセット・DAT・オープンリールのデジタル化の支援もする[7]。数字は2009年時点のものであり、現在の規模ではない。
PARADISECは2003年に言語学者と音楽学者が始め、受け継いだ録音の山をデジタル化する専門アーカイブとして、千を超える言語の記録をもつ[8]。録音が先に大量にあり、保存と整理があとから追いかける、という順序が読み取れる。
では、集めた録音を実際に使える形にするには、何が要るのか。日本のアイヌ語の例で確かめる。
5. ろくおんの 山から、ほしい はなしを さがす
5. 600時間をこえる録音を、検索できる形にした
5. アイヌ語アーカイブ ── 600時間を超える音声と、検索・逐語表示の設計
アイヌみんぞく はくぶつかんでは、1976ねんから 2000ねんごろまで、アイヌごを はなせる 人に、はなしを きいて ろくおんしました。ぜんぶで 600じかんを こえます[9]。
600じかんは、1日 8じかん ききつづけても 75日ぶんです。ききたい ところを さがすだけで、たいへんです。
そこで、いまは「アイヌごアーカイブ」と いう サイトで、おはなしや うたの こえを さがせます[10]。たんごの 一ぶだけでも さがせます。
こえや ぶんしょうは、かってに うつしては いけません。つかう ときは、サイトの きまりを よみます。
1976年から約四半世紀の聞き取り
アイヌ民族博物館は、1976年の設立から2000年ごろまで、日高地方を中心に、道内のアイヌ語を話す人や伝承者への聞き取りを録音・録画テープに残しました。音声資料は合わせて600時間を超えます[9]。1日8時間聞き続けても、75日以上かかる長さです。
探せる形にするという仕事
公開されている「アイヌ語アーカイブ」は、昔話などの口承文芸、会話、歌、祈り詞の音声を収めています。国立アイヌ民族博物館と二風谷アイヌ文化博物館の所蔵資料です[10]。
検索は、アイヌ語(カナ・ローマ字)でも日本語でもでき、単語の一部だけでも見つかります。聞き手と話者の日本語まで含めた逐語の表示もあります[10]。音声や本文の転載には条件があるため、使うときは、サイトの案内を読むことになります。
ところが、録音を文字に起こす作業そのものは、人の手で行うので時間がかかります。ここに、新しい技術が出てきます。
アイヌ民族博物館は、1976年の設立から2000年ごろまで、日高地方を中心に道内の話者・伝承者への聞き取りを録音・録画テープに残した。音声資料は合わせて600時間を超える[9]。毎日8時間聞いても75日以上かかる量だ。
この資料は、国立アイヌ民族博物館と二風谷アイヌ文化博物館の所蔵として、「アイヌ語アーカイブ」で公開されている。口承文芸・会話・歌・祈り詞の音声を収め、アイヌ語(カナ・ローマ字)・日本語での検索、単語の一部での検索、聞き手と話者の日本語を含む逐語表示に対応する[10]。録音を「聴ける」状態から「探せる」状態に変えるには、文字との対応づけが要る。
ただし、音声・本文の転載は禁止され、引用には条件がある[10]。文化庁は、ユネスコが「最も消滅の危機に瀕している」と認定するアイヌ語の音声資料の公開を、アーカイブ事業として進めている[9]。
では、文字との対応づけ、つまり文字起こしの作業を、機械に手伝わせることはできるのか。
6. ろくおんを もじに する しごとは、どうなる?
6. 音声を自動で文字にするAIは、どこまでできたか
6. アイヌ語の音声認識 ── 約40時間の民話で測った認識率
ろくおんを もじに する しごとは、人が ききながら すすめるので、じかんが かかります。
2020ねんに、京都大学の チームが、アイヌごの こえを ききとる AIを つくりました[11]。10人ほどが かたった、40じかんほどの むかしばなしを つかって おしえました。
けっかは、ことばを 10こ ききとると、そのうち 8こほどが あっていた、と いうものです[11]。ただし、これは じっけんの なかでの かずで、どんな はなしでも 8わり あたる わけでは ありません。
約40時間の民話で学んだAI
京都大学の研究チームは2020年、アイヌ語の音声を自動で認識し、合成もできるAIを開発したと発表しました。約10名が語った約40時間の民話(ウエペケㇾ)の音声を使い、音素認識率94%、単語認識率80%を達成したということです[11]。
単語認識率80%は、おおよそ「5つの単語のうち4つが合っている」という意味です。ただし、これは実験の条件での値です。別の話者や別の話題で同じ結果になるとは限りません。
人の手とのかけ合わせ
AIの出した文字を、人が聞いて直す形で使えば、文字起こしの時間を縮められる可能性があります。ここには、話を聞いて、正しく書ける人の力が欠かせません。
声の保存、整理、そして文字起こしと、仕事は次々と続いています。最後の章で、自分でも確かめる道を紹介します。
京都大学の研究チームは2020年10月、アイヌ語の音声認識・合成の研究成果を発表した。約10名・約40時間の民話(ウエペケㇾ)の音声データを用い、音素認識率94%、単語認識率80%に達した[11]。
この数値は実験条件での値であり、80%は「単語の約8割を正しく認識した」という意味にとどまる。未知の話者・話題・録音環境での性能までは示さない。学習データの作成に人手の負担があることも、研究の前提に含まれる。
ここまでの道すじを振り返ると、記録の型は、文字の考案、ローマ字表記、録音、検索できるアーカイブ、音声認識と、役割が重なりながら進んでいる。どれか1つで足りるわけではない。「文字がない」ことと「記録がない」ことは別で、鍵は、録音を保存し、整理し、読める形に近づける継続的な仕事にある。
自分でも しらべて みたくなったら
自分でも調べてみたくなったら
自分でも調べてみたくなったら
きょう できること
おうちの 人に たのんで、むかしばなしや、いえで よく つかう ことばを こえに だして もらいましょう。スマホで ろくおんして、「いつ・だれが・どんな はなしか」を ひとこと メモします。メモが あると、あとで さがしやすくなります。
でかけて できること
ちかくの としょかんで、『アイヌ しんようしゅう』を さがして みましょう。ひだりの ページと みぎの ページを くらべると、ならび方が わかります。
しらべる ばしょ
「アイヌごアーカイブ」では、アイヌごの こえを きく ことが できます。つかう ときは、サイトの きまりを よんで ください。
しらべた もとの じょうほう
参考にした情報源
参考にした情報源と、その使い方
参照した資料のうち、公的機関・大学・博物館のものを中心に使い、検索結果の要約だけで確かめた数字は、断定を弱めて書いた。
- Ethnologue「How many languages in the world are unwritten?」。https://www.ethnologue.com/faq/how-many-languages-unwritten (文字をもたない言語の割合について。第25版の数字)
- New Georgia Encyclopedia「Sequoyah」。https://www.georgiaencyclopedia.org/articles/history-archaeology/sequoyah-ca-1770-ca-1840/ (チェロキー音節文字と新聞について)
- U.S. National Library of Medicine「Native Voices」年表(1821年)。https://www.nlm.nih.gov/nativevoices/timeline/270.html (音節文字の発表年と、1文字が1音節を表すことについて)
- 北海道大学学術成果コレクション(HUSCAP)所収の論文。https://eprints.lib.hokudai.ac.jp/repo/huscap/all/90879/04_171_Sato.pdf (『アイヌ神謡集』の構成について)
- 知里幸恵についての解説ページ。https://www.asahi-net.or.jp/~PB5H-OOTK/pages/SAKKA/ti/chiriyukie.html (幸恵の祖母が語り手だったことについて。個人運営の解説ページ)
- PARADISEC blog「Distinguishing language documentation and language description, revisited」。https://www.paradisec.org.au/blog/2012/08/distinguishing-language-documentation-and-language-description-revisited/ (言語ドキュメンテーションの考え方について)
- PARADISEC blog「The Endangered Languages Archive at SOAS」(2009年)。https://www.paradisec.org.au/blog/2009/01/the-endangered-languages-archive-at-soas-developing-and-sharing-language-materials-through-archiving/ (ELARの設立と規模について。2009年時点)
- PARADISEC blog。https://www.paradisec.org.au/blog/?p=3773 (PARADISECの設立について)
- 文化庁「アイヌ語アーカイブ事業」。https://www.bunka.go.jp/seisaku/kokugo_nihongo/kokugo_shisaku/kikigengo/archivejigyo/index.html (アイヌ語の音声資料の公開について。録音の規模はアイヌ民族博物館の整理による)
- アイヌ語アーカイブ(国立アイヌ民族博物館ほか)。https://ainugo.nam.go.jp/ (収録内容と検索機能について)
- 京都大学 研究成果(2020年10月)。https://www.kyoto-u.ac.jp/ja/research-news/2020-10-15-0 (アイヌ語の音声認識の研究について)
なおした ところ
更新履歴
更新履歴(改版の記録)
- 初版を公開。
このサイトでは、公開した記事の本文は原則として書き直しません。誤りが見つかったときや、内容が古くなったときだけ手を入れ、その理由をこの欄に残します。