中国語文字起こし、簡体字・繁体字・声調のすべて
文字起こし中国語マンダリン言語

中国語文字起こし、簡体字・繁体字・声調のすべて

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

2026年なら、きれいなスタジオ音声のマンダリン文字起こしは十分実用的。ただ、始める前に3つ決める必要がある。簡体字か繁体字か、どの言語コードを使うか、そして音声が実は広東語じゃないか(ASR的には別言語)。声調はエンジンが自動処理して、文字起こし結果には出てこない。同音異義語の判別と、マンダリンと英語の混在が主な精度の落とし穴。ミーティングボットなしでクリーンな文字起こしが欲しいなら、ConvertAudioToTextが簡体字・繁体字両対応で、/tools/audio-to-textにある。

2026年の中国語(マンダリン)文字起こしは、正しい言語コードを設定し、エンジンが何を自動で解決できて何ができないかを理解すれば、クリーンで読みやすいテキストが得られます。始める前に重要な判断は2つだけです。どの文字セットが必要か、そして音声が本当にマンダリンであって広東語ではないか、ということです。

マンダリン出力は簡体字か繁体字のどちらかになります。翻訳は別機能です
マンダリン出力は簡体字か繁体字のどちらかになります。翻訳は別機能です

簡体字と繁体字の違い:音声ではなく、あなたの読者が基準

録音内の話し言葉は、話し手が上海出身でも台北出身でもシンガポール出身でも同じです。しかし、書き出される文字は同じではありません。簡体字(jiantizi)は中国本土とシンガポールで標準です。繁体字(fantizi)は台湾、香港、マカオ、そして華僑系の出版で標準です。

主要なASRエンジンはすべて、指定された言語コードに基づいてマンダリン音声をどちらかの文字セットに振り分けます:

  • zh または zh-CN または zh-Hans:簡体字出力
  • zh-TW または zh-Hant:繁体字出力
  • zh-HK:Deepgram Nova-3では、これは広東語の繁体字を特に扱います

言語コードを明示的に設定することが重要です。 短いクリップやノイズの多いマンダリン音声での自動言語検出には既知の欠陥があります。Deepgram自身の課題トラッカーには、Nova-2とNova-3でマンダリンが英語と誤判定されるケースが記録されています。常に明示的なコードを渡してください。

ワークフローが両方の地域にまたがる場合、より安全な方法は簡体字で文字起こしし、OpenCCのような文脈を考慮したツールで繁体字に変換することです。単純な文字置換テーブルではうまくいきません。なぜなら、多くの簡体字が複数の繁体字に対応し、正しいものを選ぶには文脈が必要だからです。一対多の対応、例えば發/髮(どちらも簡体字では「发」)は、その単語が「送る」を意味するのか「髪」を意味するのかを知る必要があります。

なぜ声調が文字起こしに現れないのか

マンダリンの四声(プラス軽声)は、エンジンが解決すべき問題であり、あなたが記号を付けるものではありません。書き起こし出力は標準的な中国語の漢字で、声調記号は付きません。エンジンが実際に行っているのは、音声情報を音響的に使って同音異義語のセットから正しい漢字を選び、その漢字を音なしで出力することです。

同音異義語は、マンダリン書き起こしにおける最大の精度リスクです。 マンダリンの音素目録は、それが符号化する形態素の数に比べて小さいため、多くの音節が同じように聞こえます。shì は「是」(正しい)、「事」(こと)、「室」(部屋)、「市」(市場)、「勢」(勢力)など、数十もの意味を持ち得ます。エンジンはこれを音声学だけではなく、文脈と言語モデルから解決しなければなりません。

専門分野特有の用語は、この問題をさらに難しくします。医療録音で「心」(心臓)と「新」(新しい)を複合語で使い分ける場合や、法律文脈で「法」(法律)と「発」(発する)を使い分ける場合には、一般的なモデルが持っていないかもしれない専門知識が必要です。利用可能な場合は主要用語の用語集を提供することで、これらのエラーを減らせます。中国語の名前は特に脆弱です。なぜなら、名前には小さな漢字プールがあり、同音異義語の選択肢が多く、厳格な慣習がないからです。

声調記号付きのピンイン出力(你好 ではなく nǐ hǎo)は、言語学習の文脈でのみ有用な二次形式です。他の目的の標準的な書き起こしは漢字を使用します。

マンダリンと広東語:2つの異なるASR問題

この区別は実務上重要で、しばしば誤解されます。広東語(粤語)は、ASRの目的においてマンダリンとは別の言語であり、地域のアクセントではありません。

広東語には、マンダリンの四声プラス軽声に対して六声があり、音韻体系も異なり、口語の話し言葉とその書き言葉の表現との間には大きな隔たりがあります。香港の話者は、広東語の音声と、マンダリンの文法構造を表すかもしれない中国語の漢字との間でコードスイッチングを行います。これにより、広東語のASRは技術的なレベルでもより難しい問題になります。

Fragment 3:

北京語(マンダリン)で学習されたモデルに広東語の音声を入力すると、音声的に最も似ている北京語の単語に書き起こされ、一見関連しているように見えるものの、単語レベルでは頻繁に誤りを含む出力になります。精度の低下は、小さな劣化では済みません。

Deepgram Nova-3 は現在、zh-HK を広東語(繁体字)として、北京語の簡体字および繁体字のバリアントとは別にリストアップしています。この分離は、アーキテクチャ上の正しい判断です。区別しないツールを使う場合は、香港や広東のコンテンツを書き起こす前に、広東語がサポート言語として明示されているかを確認してください。

北京語と広東語が混在する会議(香港の企業環境では一般的)では、実用的なワークフローとして、北京語モデルで書き起こし、コードスイッチングが発生したセグメントを広東語に堪能な編集者がレビューする工程を計画するのが良いでしょう。

これらの精度ギャップの背後にあるトレーニングデータの仕組みについては、AIが低リソース言語で苦戦する理由 を参照してください。

台湾華語(国語)と中国本土の北京語(普通話)

国語と普通話は共通の書き言葉の標準と相互理解可能性を共有していますが、ASR に影響を与える点で違いがあります。

音響的な違い: 台湾華語には児化(北京語の話し言葉で一般的な「儿」の接尾辞、例えば「どこ」を意味する nǎlǐ ではなく nǎr)がありません。台湾の話者は、そり舌音の zh/ch/sh を z/c/s に統合することも一般的で、「zhōngwén」は「zōngwén」に近く聞こえます。ピッチの範囲も異なります。台湾華語の話者は、より狭いピッチ範囲を使うことが多く、上昇調が音響的に下降上昇調に似ることがあります。

語彙の違い: 最も一般的に使われる7,000文字を対象とした研究では、台湾と本土の標準的な使用法の間に約18%の乖離が見られ、最も頻度の高い3,500文字では13%に低下します。これには、台湾語(ホッケン語)や日本語に由来する台湾独自の用語が含まれ、本土で学習されたモデルは、他の文字を使った音声的な近似として書き起こす可能性があります。

Fragment 4:

zh-TW を設定すると、エンジンは台湾の話し言葉に適した期待値にルーティングされ、繁体字出力が保証されます。zh-TW コードは単なる文字セットの問題ではなく、適切に設定されたモデルでは、国語の音韻論に合わせて音響的重み付けも調整されます。

中国語と英語のコードスイッチングの実践

テック系やビジネス系の中国語には、ほぼ必ず英語が混ざります。「我們需要review一下這個PR」(このPRをレビューする必要があります)や「這個KPI很重要」(このKPIは重要です)といった文は、中国のテクノロジー企業では標準的な話し言葉です。

よく訓練された多言語モデルは、英語の単語をラテン文字のまま保持し、音声化しないことでこれを処理します。期待される出力は次の通りです。reviewreview のまま、KPI や OKR のような頭字語はラテン文字のまま、Apple や Google のような固有名詞は英語のまま残ります。

失敗が起きやすいのはコードスイッチングの境界部分で、エンジンが音節を落としたり、短い英語の単語を北京語の形態素として誤って解析したりすることがあります。節の途中での切り替え(「因為這個API...」など)は、単語全体の挿入よりも難しいです。音声に節の途中の英語が多く含まれる場合は、パイプラインを確定する前に実際のサンプルでテストしてください。

実用的な修正手順については、多言語コードスイッチングの問題を修正する方法 を参照してください。

全角句読点は省略不可

正しくフォーマットされた北京語の文字起こしでは、GB/T 15834-2011 で標準化された全角句読点を使用します。

  • 。は文末のピリオド(. ではなく)
  • ,はカンマ(, ではなく)
  • 、はリスト内の列挙の区切り
  • :はコロン
  • 「」または《》は引用の文脈

文字起こし出力が半角の ASCII 句読点(.,)を含む北京語テキストを返す場合、その文字起こしは非標準です。中国本土の読者向け、台湾の読者向け、または中国語の文書として公開する場合、使用前に修正が必要です。一部のツールはデフォルトで正しい全角句読点を生成しますが、他のツールは後処理を必要とします。

2026年の北京語対応エンジンサポート

Deepgram Nova-3 は、2026年の中国語(マンダリン)対応における際立った変更点です。Nova-3は簡体字(zhzh-CNzh-Hans)、繁体字(zh-TWzh-Hant)、広東語(zh-HK)を明示的なバリアントとしてサポートしています。Deepgramは、簡体字マンダリンのバッチ文字起こしにおいて、Nova-2と比較して相対WER(単語誤り率)が65.21%削減されたと報告しており、繁体字では44.87%の削減となっています。これらは相対的な改善率であり、絶対的な精度の数値ではありませんが、方向性としての改善はかなり大きいと言えます。このエンジンの詳細については、Deepgram Nova-3の解説をご覧ください。

AssemblyAI Universal-2 は中国語(マンダリン)をサポートしており、同社のドキュメントによると「WERが10%超、25%以下」の精度帯に位置づけられています。つまり、動作はしますが、中国語は同社の最高精度ティアには含まれていません。Universal-3 Proモデルのドキュメントでは、2026年半ば時点で詳細な言語サポート表に中国語が記載されていないため、AssemblyAIで中国語を扱う場合、Universal-2が確認済みのルートとなります。

OpenAI Whisper Large-v3 は、マンダリンを妥当な性能で処理します。中国語特化のファインチューニング済みバリアント(例:Belle-whisper-large-v3-zh)は、ベースモデルと比較して中国語ASRベンチマークで24%から65%の相対的な改善を示しており、これはベースモデルのマンダリン性能の上限がどこにあるかを示す指標となります。技術的またはドメイン特化型の中国語コンテンツを扱う場合、ファインチューニング済みバリアントを評価する価値があります。

四川方言、上海アクセントのマンダリン、福建語の影響を受けたマンダリンなど、標準的でない音韻を多用する地域的なマンダリンは、依然として主要エンジンすべてにおいて標準的な普通話の精度を下回ります。トレーニングデータがフォーマルな放送用マンダリンに偏っていることは、構造的な限界です。

低リソース言語における各エンジンの性能比較については、文字起こし精度の解説をご参照ください。

中国語文字起こしのツール比較

機能Otter.aiNottaDeepgram Nova-3 APICATT
簡体中国語対応(ベータ版)対応対応(zh-CN)対応
繁体中国語非対応(簡体のみ)対応対応(zh-TW)対応(zh-TW)
広東語非対応対応対応(zh-HK、別途)限定的
中国語のAI要約英語のみ中国語独自LLMが必要中国語
無料プラン月300分月120分$200のAPIクレジット無料プランあり
有料価格月$8.33(年払い)月$9.99(年払い)バッチ処理で$0.0043/分月$9.99、無制限
コードスイッチング限定的そこそこモデルによる対応

Otterの中国語サポートは簡体字のみで、公式ドキュメントでもベータ版と明記されています。台湾向けのコンテンツや繁体字出力が必要なケースには不向きです。Nottaは簡体・繁体の両方に対応し、中国語の音声文字起こし専用ページも用意されており、本格的に中国語に投資していることがうかがえます。DeepgramのAPIルートなら言語コードやバリエーションを最も細かく制御できますが、その分自前での統合が必要です。

私の見解としては、ミーティングボットに依存せず、単体の音声ファイルからきれいな簡体・繁体の出力を得たいなら、ConvertAudioToTextが素直な選択肢です。自社製品を構築する多言語APIパイプラインなら、2026年時点で中国語のWER改善が文書化されているDeepgram Nova-3から始めるのが妥当でしょう。

中国語の話者分離

中国語のビジネス音声は、フォーマルな場面では構造化されたターンテイキングになる傾向があります。明確な間合いのある2人インタビューは、話者が重なるカジュアルなポッドキャストよりも、きれいな話者分離が得られます。

北京語特有の話者分離の難しさは、中国語の会話規範にあります。話し手が話し続ける間、聞き手が低い声で相槌(嗯、对、好)を打つことが一般的で、これが精度の低い話者分離ツールでは誤った話者交代イベントとして検出されてしまうのです。

マイクごとの録音が利用できる場合は、これらほとんどのエラーが解消されます。ポッドキャスト形式の音声でマイクが1本の場合は、重なり合う区間の話者分離について軽いレビューを計画しておきましょう。

これらのケースを基盤となるアルゴリズムがどう処理するかは、話者分離の解説をご覧ください。

北京語の文字起こしを改善するためのヒント

  1. 正確な言語コードを設定する:簡体字はzh-CN、繁体字はzh-TW、広東語はzh-HK。短いクリップではデフォルトの検出が信頼できないことがあります。
  2. 処理前に固有名詞(人名、ブランド名、社内製品名)の用語集を用意する。中国語の名前は特に同音異義語の誤選択が起きやすいです。
  3. 技術的な内容の場合は、ドメイン用語を含める。複合語として机器学习(機械学習)を知らないモデルは、それを誤って分割する可能性があります。
  4. ノイズの少ない環境で録音する。声調の区別が主な識別シグナルであり、背景ノイズで圧縮されます。
  5. 広東語の音声は、北京語設定の変種としてではなく、別のツールまたは別の言語コードを必要とするものとして扱う。
  6. 中国語のAI要約については、ツールが英語で要約して完了とするのではなく、中国語で要約を生成することを確認する。西洋向けの会議ツールのほとんどは英語の要約のみを提供します。

FAQ

文字起こしの出力は簡体字中国語と繁体字中国語のどちらを使うべきですか?

対象読者に合わせてください:中国本土とシンガポールのコンテンツは簡体字(zh-CN)、台湾は繁体字(zh-TW)、香港はzh-HK。同じ話し言葉の北京語でも、エンジンに渡す言語コードによって出力される文字が異なります。読者が複数の地域にまたがる場合は、簡体字で文字起こしし、OpenCCのような文脈対応ライブラリを使って変換するのが良いでしょう。これは、複数の繁体字にマッピングされる多くの簡体字を処理します。

北京語の文字起こしに声調は表示されますか?

いいえ。標準の北京語トランスクリプトは漢字を出力し、声調記号付きのピンインは出力しません。エンジンは声調の区別を使って同音異義語を判別し、正しい漢字を選びますが、その区別は文字選択のプロセスに吸収され、印刷されることはありません。結果は、読者が期待する形のきれいなテキスト、つまり「nǐ hǎo」ではなく「你好」のような形になります。

中国語を選択しても広東語の精度が落ちるのはなぜですか?

広東語(粤語)は北京語とは別の言語であり、北京語のアクセントではありません。広東語には北京語の四声プラス軽声と比べて六声があり、音韻体系も異なり、標準化された書き言葉も限られています。北京語のデータで訓練されたASRエンジンは、広東語の音声に対しては性能が著しく低下します。Deepgram Nova-3はzh-HKを別のバリアントとして提供しており、これが広東語音声に適したコードです。他のツールでは、一般的な中国語設定で香港の広東語コンテンツを書き起こす前に、広東語が独立した言語オプションとしてリストされているか確認してください。

北京語と英語のコードスイッチングはトランスクリプションにどう影響しますか?

テックやビジネスの北京語では、文中に英語の用語が頻繁に混ざります。よく訓練された多言語モデルは、英語の単語を漢字に音訳するのではなく、ラテン文字のまま保持することでこれに対応します。KPI、OKR、APIのような頭字語はラテン文字のままです。AppleやMicrosoftのような製品名も同様です。課題となるのは、話者が単語の途中ではなく節の途中で切り替える場合です。一部のエンジンは切り替えの境界で音節を落とすことがあります。パイプラインを確定する前に、実際の音声サンプルでテストする価値はあります。

北京語のトランスクリプションにはどの言語コードを使うべきですか?

簡体字北京語には、zh、zh-CN、またはzh-Hansを使用します。繁体字には、zh-TWまたはzh-Hantを使用します。Deepgram Nova-3では、zh-HKは広東語の繁体字です。AssemblyAI Universal-2では、北京語中国語がサポートされています。短いクリップやノイズの多いクリップでは北京語が他の言語と誤認される可能性があるため、自動言語検出に頼らず、常にバリアントを明示的に設定してください。

台湾华语(国语)与大陆普通话的处理方式不同吗?

两者非常接近,大多数引擎都能用同一个普通话模型来处理,但在可测量的层面上确实存在差异。台湾华语没有北京话中常见的儿化音,而且说话者常把卷舌音 zh/ch/sh 合并成 z/c/s。词汇上也有区别:台湾和大陆在标准用法上,大约有 13% 到 18% 的常用字不同。设置 zh-TW 会向引擎传达这些预期,同时也会将输出导向繁体字,这是台湾的标准书写系统。

参考来源

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles