オランダ語とフラマン語の文字起こし、その違いの実態
文字起こしオランダ語フラマン語言語

オランダ語とフラマン語の文字起こし、その違いの実態

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

標準的なオランダのオランダ語は、Whisper Large-v3でフォーマルな音声なら誤認識率およそ5%と、きれいに文字起こしできる。でもベルギーのフラマン語だと、エラーが3〜8ポイント増える。さらに日常的なtussentaal(標準語と方言の間のくだけた話し言葉)になると、もっと悪化する。この差は構造的なもので、ほとんどのASR学習データがオランダの放送音声に偏っていて、アントワープの食卓での会話は想定外なのだ。Otter.aiはオランダ語に全く対応していない。対応しているツールはTurboScribe、Happy Scribe、Amberscript(オランダ語ネイティブ)、CATTなど。

オランダ語とフラマン語の文字起こしにおける根本的な問題は、言語そのものではない。オランダ語は主要なASRエンジンすべてでしっかりサポートされている。問題は、標準的なオランダのオランダ語と、日常的なベルギーのフラマン語は、音韻的にも語彙的にも十分に乖離しているため、精度の数字に意味のある差が出ることだ。そして、ほとんどのツールはオランダの放送データを中心に訓練されている。

ツールやレビューワークフローを選ぶ前に、自分の音声がどのレジスター(文体)と地域に属するかを把握しておくことが、他のどんな単一の判断よりも時間の節約になる。

変種のギャップ:数字が実際に示すもの

Whisper Large-v3は、クリーンでフォーマルなオランダのオランダ語音声でおよそ5%のWERを達成し、英語に近い性能を示す。フォーマルな標準ベルギー・オランダ語(VRTのニュースルームで使われる種類)の場合、その差は控えめだ。Corpus Gesproken Nederlandsを使った研究者の報告によると、オランダ標準語と比べてWERは1〜3ポイント高い程度である。

しかし、インフォーマルなレジスターに移るにつれて、その差は急速に広がる:

  • Tussentaal(ベルギーの日常的な中間レジスター):典型的な会話音声では、WER 10〜15%が妥当な見込みだ。
  • 周辺方言:西フラマン語とベルギーのリンブルフ語は、文書化されたASRバイアスが一貫して見られる。2023年のESSV研究は、西フランダースとリンブルフの話者に対する性能低下を確認している。CGNコーパスのベンチマークでは、方言フラマン語でWERが25%に達し、最も重い地域変種では66%にも達することが示されている。
  • フリジア語(オランダのフリースラント州で話される):オランダ語とは別の西ゲルマン語派の言語だ。本格的な対応をする商用ASRツールは存在せず、オランダ語パイプラインでフリジア語を文字起こしすると、WER 60〜70%以上になることを覚悟すべきだ。

Whisperが受け付ける単一の「nl」言語コードは、nl-NLとnl-BEを区別しない。OpenAIはオランダのデータを優先的に訓練しているため、ベルギーの音声を扱っていても、モデルの事前分布はオランダの発音に引っ張られる。

なぜフラマン語はASRモデルに違って聞こえるのか

音声認識の精度ギャップの大部分は、3つの音韻的特徴に起因している。

Gの分裂。 オランダ北部のオランダ語は、耳障りな口蓋垂音または軟口蓋摩擦音であるハードGを使用する。ベルギーでは、より柔らかく、より前方で発音されるザフトGを使用する。これらは音声学的に十分に異なるため、厳しい北部のGで調整されたモデルは、ベルギー訛りの同じ音素を誤分類したり、重み付けを誤ったりする。オランダ語のほぼすべての文にGが登場するため、この1つの特徴がトランスクリプト全体に累積的に影響する。

旋律的なイントネーション。 フラマン語の話し言葉には、顕著に音楽的で上昇するイントネーションのパターンがある。オランダのオランダ語は、より平坦で下降する輪郭に傾く傾向がある。ASRモデルは韻律から部分的に単語の境界や節構造を推測するため、フラマン語の異なるピッチの動きは、それらの境界で系統的な不確実性をもたらす。

母音の長さと丸め。 フラマン語の母音は、オランダの同等の母音よりも丸みが強く、長く伸ばされることが多い。ベルギーオランダ語の長い/a:/は、アムステルダムの話者が発音する同じ母音とはわずかに異なる音響空間に位置する。ベルギーのデータに特化して微調整されたオランダ語モデルが、汎用モデルよりも優れているのは、まさにこのためである。

Tussentaal: 誰もトレーニングしていないレジスター

Tussentaalは、ベルギーの口語オランダ語である。方言でもなく、標準オランダ語でもなく、ほとんどのフラマン語話者が非公式な場面で使う流動的な中間レジスターだ。その特徴は具体的に次の通り。

  • 二人称代名詞: 標準の「jij/je」ではなく「gij/ge」、それに伴う動詞形(「jij bent」ではなく「gij zijt」)。
  • フランス語からの借用語が織り交ぜられる: 「merci」「allez」「kot」(学生部屋)、「schoon」(非公式な場での「美しい」)、「mobiel」ではなく「GSM」。
  • ベルギー特有の語彙: 「goesting hebben」(何かをしたい気分である)、感嘆詞の「amai」、冷蔵庫を指す「frigo」。
  • 地域方言と放送標準語が混ざった発音。

トレーニングで「gij zijt」を見たことがないASRモデルは、「jij bent」と出力するか、フレーズ全体をめちゃくちゃにする。フランダースのポッドキャストやインタビュー音声を扱うなら、tussentaal(話し言葉の方言)を前提に、その分のレビュー時間を確保しておこう。

コードスイッチング:英語とフランス語

オランダ語のビジネスやテック系音声は英語と頻繁にコードスイッチする。特にアムステルダム、ユトレヒト、アントワープの企業環境で顕著だ。Whisper Large-v3は文の境界での切り替えはうまく処理する。文の途中での切り替えは、英語の単語が音声的に近似された形で出ることがあり、一回の修正パスが必要になる。

ベルギー・オランダ語はフランス語ともコードスイッチする。特にブリュッセルや年配のフランダース話者に多い。「allez」「merci」「voila」「bonjour」といった単語が、オランダ語の文の中に普通に出てくる。これらのフランス語断片はWhisperのトレーニングデータに含まれているため、たいてい正しく書き起こされる。ただし、フランス語の固有名詞がオランダ語風の発音に変わってしまうケースには注意が必要だ。

オランダ語の表記と発音区別符号

オランダ語はラテンアルファベットを使う。書き起こし特有の主な問題点は次の通り:

  • 二重音字 ij はオランダ語では一つの母音として機能し、オランダ語キーボードでは単一の文字として入力されることもある。正しい書き起こしでは「ij」を一貫して使う(「IJ」や「y」ではなく)。
  • 分音記号(トレマ)は母音の分離を示す:「Belgie」は正しくは「Belgie」と分音記号付きで書く(「Belgie」ではなく)、「geinteresseerd」は2番目のeに分音記号が付く。ツールが分音記号を落とすと、正式な文書で重要になる正書法の正確さが失われる。
  • アクサン記号は借用語や強調で現れる:「cafe」「resume」など。
  • オランダ語の複合語は続けて書く:「autoverzekering」(自動車保険)であって「auto verzekering」ではない。オランダ語の複合語を一貫性なく分割したテキストでトレーニングされたASRモデルは、断片的な出力を生む。

オランダ語とフランダース語の音声ファイル用CATT音声アップロードツール
オランダ語とフランダース語の音声ファイル用CATT音声アップロードツール

実際にオランダ語に対応しているツールの比較

まず訂正です。Otter.aiはオランダ語に対応していません。2026年半ば時点で、Otterの言語リストは英語、フランス語、スペイン語、ドイツ語、日本語、中国語のみです。オランダ語の文字起こし比較でその名前を出すべきではありません。

ツールオランダ語対応フラマン語(nl-BE)無料プラン開始価格
TurboScribe対応(Whisperベース)一般のnl経由1日3ファイル(各最大30分)月$10(年払い)
Happy Scribe対応個別リストなし10分の試用のみ月€17(AI 120分)
Amberscript対応、オランダ語ネイティブnl-BE明示対応なし従量制、約€0.25/分
Trint対応ベルギー向け別バリアントなし7日間試用、最大3ファイル月約$52/席(年払い)
CATT対応(Whisper + AssemblyAI)一般のnl経由10分無料、一度きり月$9.99、無制限

Happy Scribeの価格はユーロ建てです(Basic月€17、Pro月€29、超過分は€0.20/分)。Trintは席単位で月約$52/席(年払い)で、個人ユーザーよりニュースルーム向けに設計されています。Amberscriptは、専任のオランダ語チームと明示的なnl-BE認識を持つ唯一のツールで、高品質なフラマン語案件には重要です。

私の見解:オランダ語のポッドキャストやインタビュー録音で、英語ではなくオランダ語のAI要約が欲しい場合、CATTの音声テキスト化ツールは分単位の上限なしで両バリアントを処理します。フラマン語の企業コンテンツで、正式なベルギー語の正確さが最優先でコストが二の次なら、Amberscriptのオランダ語ネイティブパイプラインはそのプレミアム価格に見合います。深い方言の音声(西フラマン語の村の会話、リンブルフ語の影響を受けた話し方)では、どのツールでも人間による修正時間を十分に予算化する覚悟が必要です。

オランダ語音声の話者分離

オランダ語のビジネス会話は通常、構造化されており、話者の交代が明確なので、話者分離に有利です。現実的な期待値は次の通りです。

  • 2人制のフォーマルなインタビュー:話者分離精度92〜96%。
  • 3〜4人制のポッドキャスト:80〜88%。
  • 5人以上、発言が重なるグループ討論:70〜82%。

カジュアルなグループの場で互いに話をかぶせるフランドル的な傾向(ベルギーの会話規範ではオランダより一般的)は、ASRの精度問題よりも話者分離を大きく劣化させます。

ASRの複合語処理

オランダ語の生産的な複合語形成は、一貫した課題です。「Arbeidsongeschiktheidsverzekering」(障害保険)、「zorgverzekeringstelsel」(医療保険制度)、あるいは「overheidsorganisatie」(政府機関)のような一般的な表現は、構成要素となる単語よりも低い頻度でトレーニングデータに出現します。強力なオランダ語語彙モデルを持たないシステムは、これらを単語境界で分割したり、途中でエラーを起こしたりします。

法律、医療、金融など専門的なオランダ語コンテンツを扱う場合は、ツールが対応していればカスタム語彙や用語集を提供してください。この単一のステップだけで、他のどの設定変更よりも複合語エラーを削減できます。

フランドルコンテンツの実践的セットアップ

  1. 言語をオランダ語("nl")に設定します。ほとんどのツールでは、別途「nl-BE」の選択肢は用意されていません。主な例外はAmberscriptです。
  2. 正式な標準ベルギー・オランダ語(ニュース、企業コミュニケーション、公式会議)の場合、オランダ語のベースラインに近い精度が期待できます。レビュー作業は1時間あたり10分未満で済むはずです。
  3. カジュアルなフランドル語のインタビューや、tussentaal(中間言語)を使ったポッドキャストの場合、録音1時間あたり15〜25分のレビュー時間を計画してください。
  4. 西フランドル方言やリンブルフ方言のコンテンツでは、母語話者レベルの方言知識を持つ人間のレビュー担当者が必須です。現在の実用的なツールでこれらの変種をきれいに処理できるものはありません。
  5. 可能であれば、マイクごとに個別録音してください。複数話者の通話では、混合音声の部屋録音と比べて話者分離(ダイアライゼーション)の精度が大幅に向上します。
  6. オランダ語には摩擦音が多く、残響の多い空間では明瞭度が落ちます。低残響の録音環境や指向性マイクは、スペイン語やイタリア語のような母音中心の言語よりも、オランダ語のASR性能を大きく向上させます。

スリナムおよびカリブ海オランダ語への対応

スリナム・オランダ語と、アルバ、キュラソー、ボネール、シント・マールテンで話されるオランダ語は、公用語としてのオランダ語でありながら、地域特有の語彙と、スラナン・トンゴやパピアメント語からの接触による影響が見られます。標準のオランダ語パイプラインでは、正式なスリナム・オランダ語に対して88〜92%の精度が出ます。地域特有の語彙(特に地名や文化的に固有の用語)は、ベースモデルの辞書に含まれていない場合があり、手動での修正が必要になります。スラナン・トンゴとパピアメント語は別言語であり、オランダ語パイプラインでは処理されません。

FAQ

Whisperは、オランダ(本国)のオランダ語と同じくらい、フランドル地方のベルギー・オランダ語をうまく処理できますか?

いいえ。きれいなフォーマルな発話では、その差はわずかです(WERでおおよそ1〜3ポイント)。インフォーマルなフラマン語、tussentaal、そして西フラマン語やリンブルフ語のような深い方言になると、その差は急激に広がります。CGNコーパスに関する研究では、標準的な発話では約7%だったWERが、方言的なフラマン語では25%以上に跳ね上がり、最も重い地域方言では66%にも達することが示されています。Whisperの単一の「nl」言語コードはnl-NLとnl-BEを区別しないため、オランダ語圏のデータを主に学習した単一モデルが適用されます。

tussentaalとは何か、そしてなぜ文字起こしに重要なのか

Tussentaal(文字通り「中間言語」)は、日常のフラマン語生活で使われるインフォーマルな話し言葉のレジスターです。学校で教わるフォーマルな標準オランダ語と深い地域方言の間に位置し、実際のベルギーの会話のほとんどはこのtussentaalで行われています。放送用オランダ語で訓練されたASRシステムは、tussentaalをノイズとして扱います。なぜなら、その発音、動詞形、語彙が書き言葉の標準から逸脱しているからです。文字起こしの際には、フォーマルなニュースルームのスピーチと比べて、カジュアルなベルギーのインタビューやポッドキャストはより注意深く確認する必要があると覚悟してください。

Otter.aiはオランダ語に対応していますか

いいえ。2026年半ば時点で、Otter.aiは英語、フランス語、スペイン語、ドイツ語、日本語、中国語に対応しています。オランダ語はそのリストに含まれていません。オランダ語またはフラマン語の文字起こしが必要な場合、Otter.aiは選択肢になりません。

フラマン語のコンテンツに最適な文字起こしツールはどれですか

Amberscriptはアムステルダムに本社を置き、オランダ語を話す人間のレビュアーを雇用し、nl-NLとnl-BEのサポートを明示しています。フラマン語の企業コンテンツやメディアコンテンツの正確さが重要で、予算が許す場合(従量課金で1分あたり約0.25ユーロから)、最強の選択肢です。TurboScribeとCATTは、低コストでフラマン語の作業を行うための堅実なWhisperベースのオプションで、CATTはオランダ語でのAI要約と、有料プランでの1分あたりの上限なしを提供しています。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles