
韓国語文字起こしガイド:ハングル・敬語・コングリッシュ
Summarize this article with:
短いまとめ
標準的なソウル韓国語の場合、Deepgram Nova-3とWhisper Large-v3はどちらも、正しいスピーチレベルの語尾を持つ正確なハングル文字起こしを生成します。済州方言や方言の多いコンテンツでは、専門の韓国語ネイティブエンジンだけがその差をうまく処理します。会議ボットやアカウント設定なしでクリーンな文字起こしが必要なら、ConvertAudioToTextが話者ラベル付きで韓国語に対応しています。無料アカウントには登録時に一度だけ付与される10分間の文字起こしが含まれ、SRT書き出しは有料プランまたは7日間のトライアルで利用できます。

韓国語の文字起こしに固有の難しさがある理由
韓国語がAIにとって難しいのは、アルファベットのせいではありません。ハングルは世界で最も音素規則的な書記体系のひとつで、各音節ブロックが子音と母音を一定のパターンで符号化し、中国語の文字起こしをまったく別の問題にするような文字の曖昧さはありません。
本当の難しさは構造的かつ社会的なものです。
韓国語の分かち書きは任意で、意見が分かれます。 正式な用語は띄어쓰기(トゥイオスギ)で、その規則はネイティブスピーカーの間でも本当に曖昧です。補助動詞は続けて書く場合も分けて書く場合もあり、依存名詞は公式には分けて書きますが、一般的には続けて書かれます。音声にはこれらの境界を示すポーズがないため、AIエンジンは膠着的な動詞連鎖をどこで分割するかを決めなければなりません。Deepgramは、韓国語の複合名詞の分かち書きをNova-3で対処した「中核的な課題」のひとつとして文書化しています。Whisperの評価論文では、単語誤り率(WER)ではなく文字誤り率(CER)を韓国語に使用しています。これはまさに単語の区切りが可変であるためです。「받아도 돼요」を「받아도돼요」と結合してしまうエンジンは、単なる書式の好みではなく、異なる文法構造を生み出しています。
韓国語の動詞は社会的階層を符号化します。 単語を正しく認識するだけでは不十分です。ある話者が하십시오체(ハシプシオ体)を使い、別の話者が해체(ヘチェ体)を使った場合に、全員を해요체(ヘヨ体)に正規化した文字起こしは、韓国語の読者が参加者間の関係を再構築するために使う情報を失っています。下記の敬語セクションを参照してください。
借用語は同時に2つの文字体系に存在します。 韓国語のビジネス会話では、ハングル表記の英語(핸드폰、카페、아파트)とラテン文字の頭字語やブランド名(PM、OKR、KPI、ChatGPT)が混在します。正しい文字起こしはそれぞれを正しい文字体系に置かなければならず、その対応は音声だけからは予測できません。컴퓨터(コンピューター)はハングルで返されますが、「IT」はラテン文字のままです。それが韓国人の書き方だからです。
敬語の問題と文字起こしにおける重要性
韓国語には존댓말(ジョンデマル)と呼ばれるスピーチレベルの体系があり、敬語の語彙とは区別されます。スピーチレベルは動詞の語尾に符号化され、話者と聞き手の関係を示します。対象との関係ではありません。 韓国語の文字起こしは、話者の実際の動詞の語尾を再現しなければなりません。
現代の会話で今も一般的な3つのレベル:
- 하십시오체(ハシプシオ体): 格式敬語。ニュース放送、就職面接、軍隊、ビジネスプレゼンテーション、サービス業、目上の人との初対面で標準的。動詞語尾:-(으)십시오、-(으)ㅂ니다。
- 해요체(ヘヨ体): カジュアル敬語。大人の日常会話、ほとんどの顧客対応、視聴者に向かうコンテンツクリエイターのデフォルト。
- 해체(ヘチェ体): インフォーマル。親しい友人、同年齢の仲間、大人が子どもに話すときに使われる。
その他の形、하소서체(古風な最高敬語)、하게체(セミフォーマル、若い話者の間では現在まれ)、해라체(平叙・叙述、書き言葉の叙述で一般的)は、会話ではあまり現れませんが、依然として意味を持ちます。
これが文字起こしの精度に重要な理由: ビジネス会議の文字起こしが하십시오체の語尾を一貫して正しく表現していれば、韓国語の読者には誰が誰に、どのような立場で、どの程度の格式で話していたかが伝わります。単一のレベルに平坦化した文字起こしはそれを失います。Whisper Large-v3は、レジスターを正規化せずに発話内容を文字起こしするため、スピーチレベルを保持します。韓国語の放送・ビジネスデータで特別に学習されたDeepgram Nova-3も、同様に話者の実際の語尾を反映します。
エンジン対応レベル:検証済みの内容
これらのレベルは、ベンダーが文書化した内容、または独立した評価が公表した内容を反映しています。精度のパーセンテージは捏造していません。
ティア1:強力な韓国語サポート、文書化された改善
- Deepgram Nova-3(ko / ko-KR): Deepgramは、韓国語についてNova-2比で「最大27%のWER削減」を文書化したブログ記事を公開し、ハングルの分かち書きの曖昧さ、急速な活用、音節ブロックを具体的に対処した課題として挙げています。キーワードプロンプティングは韓国語でも利用可能で、ブランド名や専門用語に有用です。Nova-3とNova-2はどちらも
koとko-KRの言語コードをサポートしています。 - OpenAI Whisper Large-v3: 韓国語はWhisperの学習データにおいて比較的充実している言語のひとつで、OpenAIは韓国語のベンチマークにWERではなくCERを使用しています。Large-v3リリースでは、対応言語全体でLarge-v2比10~20%のエラー削減を示しました。ホステッドAPIとセルフホスティングのどちらを選ぶかは、Whisper APIの価格詳細をご覧ください。
ティア2:良好な精度、韓国語固有の文書は限定的
- AssemblyAI Universal-2: AssemblyAIのドキュメントでは、韓国語は「良好な精度」帯にリストされており、10%超から25%のWERと定義されています。話者分離と自動チャプターは韓国語で機能し、LeMURベースの韓国語要約はSTT層ではなく基盤となるLLMに依存します。韓国語のリアルタイムストリーミングは現在サポートされていません。
- Google Cloud Speech-to-Text(Chirpモデル): 韓国語は125以上のサポート言語に含まれます。Chirpの料金は秒単位で、15秒単位で請求され、毎月60分の無料枠があります。Chirpの韓国語WERは公表されていません。大量利用に進む前にGoogle Cloud STTの価格詳細を読んでください。
ティア3:韓国語ネイティブ、韓国インフラ
- Naver Clova Speech: Naverのモデルは韓国語のみのデータで学習されており、地域方言や口語表現で有利です。料金は秒単位でウォン建て(Naver Cloud Platformの料金計算ツールで確認可能)。サービスは韓国、米国、シンガポール、日本、ドイツのリージョンで利用できます。多言語の韓国語-英語コンテンツでは、Clovaはティア1エンジンより弱い選択肢です。
韓国語非対応:
- Otter.ai: 公式には英語、スペイン語、フランス語、ドイツ語、日本語、中国語をサポート。韓国語はリストにありません。Otterに韓国語のWERスコアを割り当てている古い比較表の精度数値は検証不能であり、無視すべきです。
ハングルのみの出力と漢字の例外
現代韓国語の表記はほぼ完全にハングルです。漢字(歴史的に韓国語の語彙に使われた中国由来の文字)は、正式な法律文書、古い出版物の新聞見出し、学術引用に時折現れますが、音声ではほとんど現れません。正しい韓国語の文字起こしはハングル出力を生成します。
話者が漢字起源の単語(ほぼすべての漢字語)に言及した場合、文字起こしはハングルの音声表記で書きます。これは韓国語のネイティブ読者が期待する形と一致します:대학교(大学)であり、歴史的文書の文脈でない限り大學校ではありません。
現代韓国語の句読点は西洋の慣習に従います:ピリオドはピリオド(.)、カンマはカンマ(,)です。古い編集スタイルでは日本由来の全角句読点(。、)が使われましたが、現代のAIエンジンによる文字起こしには現れません。
コングリッシュとコードスイッチング:エンジンがどう扱うべきか
韓国語のビジネスやテクノロジーの会話には英語が大量に混ざります。 これは非公式なスラングではなく、韓国語の職業生活の標準的なレジスターです。韓国のソフトウェア企業の会議では、「저는 PM이에요, OKR 설정해야 돼요」や「이 API 문서 업데이트해줘요」のような文が日常的に生まれます。
各要素がどの文字体系になるかのルール:
| タイプ | 例(音声) | 期待される文字起こし |
|---|---|---|
| 完全に統合された借用語 | haendeupon | 핸드폰 |
| 統合されているが短縮 | kape(カフェ) | 카페 |
| 英語の頭字語、ラテン文字のまま | O-K-R | OKR |
| 英語のブランド名 | ChatGPT | ChatGPT |
| 英語の技術用語、しばしばハングル | seobeo | 서버 |
| 混合複合語 | UI/UX | UI/UX または 유아이/유엑스(エンジン依存) |
Whisper Large-v3とDeepgram Nova-3はどちらも、一般的な借用語についてこのコードスイッチングを正しく処理します。エッジケースは標準英語ではないコングリッシュ語です:아이쇼핑(ウィンドウショッピング、「eye shopping」から)、핸드폰(携帯電話、「hand phone」から)、아파트(アパート、短縮形)。よく整備されたキーワードリストが珍しいものをカバーします。
コードスイッチングがエンジン精度にどう負荷をかけるかについては、多言語コードスイッチングを文字起こしで修正する方法をご覧ください。
地域方言:ソウルが基準、済州が外れ値
主要なAIエンジンはすべて、韓国語の精度をソウル標準韓国語(서울말)に対してベンチマークします。これは放送メディア、国営教育、ほとんどのオンラインコンテンツの方言です。
地域方言はさまざまな程度の乖離をもたらします:
- 慶尚道(경상도、釜山・大邱を含む): 独特の高低アクセント、異なる動詞語尾。標準エンジンにとってソウル韓国語より測定可能なほど難しい。
- 全羅道(전라도、光州を含む): 異なるイントネーションパターンと一部の語彙。ほとんどのエンジンがある程度の精度低下とともに認識。
- 済州(제주): 言語学的に十分に異なるため、ユネスコは韓国語本体とは別の絶滅危惧言語に分類しました。標準韓国語にない中世韓国語の特徴を保持し、多くの本土の韓国語話者にとって相互理解不能です。汎用AIエンジンは済州語で大幅に失敗します。 済州語の専用学習データを持つ専門システム、例えばPersonaAI(5万時間の韓国語学習コーパスの約4分の1を方言データに割り当てた)だけが、有意義な精度で済州語を処理します。
コンテンツに済州語話者が含まれる場合は、期待値を設定し、人間のポストエディターが必要かどうかを検討してください。
韓国語コンテンツの話者分離
韓国語のフォーマルな会話はターン構造です。カジュアルな韓国語(バラエティ番組のパネル、グループポッドキャスト)には大きな重複と割り込みがあります。
話者分離では、言語よりも条件が重要です:
- 別々のマイクで録音された2人によるフォーマルなインタビュー:話者分離は安定して機能します。
- 4~6人のビジネス会議、単一ルーム録音:より難しく、特に話者が短い相槌(네、맞아요、그렇죠)で互いに譲り合う場合は困難です。
- バラエティ番組やパネル形式:割り込みと重複する反応が、どのエンジンでも精度を低下させます。
チャンネルごとの録音(各話者を自分のトラックに)は、エンジンの選択に関係なく、話者分離の品質に対する最も効果的な改善です。
韓国語コンテンツの実践的なワークフロー
ポッドキャストとYouTube: 音声または動画ファイルをアップロードし、自動検出に頼らずに言語を韓国語に明示的に設定します(自動検出はわずかに遅く、コングリッシュの多いコンテンツを英語と混同する可能性があります)。複数ホストの番組では話者ラベルを有効にします。字幕ファイル用に韓国語SRTを書き出します。字幕生成の仕組みについては、字幕生成ツールをご覧ください。
ビジネス会議: プラットフォームが音声または動画ファイルを書き出すなら、ティア1エンジンのいずれも使用可能な韓国語文字起こしを生成します。会議ボットツール(Otter、Fireflies)は2026年半ば時点で韓国語サポートを欠いているため、ファイルベースの文字起こしが信頼できる方法です。
研究インタビュー: 韓国語の質的調査では、スピーチレベルの精度が保持された文字起こしが必要です。固有名詞の用語集(韓国語の名前には複数の可能なハングル表記があり、이は名前によって이、리、または리になり得る)が最も一般的な誤認識を防ぎます。
YouTubeコンテンツ: YouTube文字起こしジェネレーターは韓国語の動画を直接受け付けます。
私の見解:ほとんどの韓国語コンテンツでは、Whisper Large-v3とDeepgram Nova-3の選択は実際にはわずかな差です。Deepgramの文書化された韓国語の改善とキーワードプロンプティングは、専門性の高いコンテンツ(法律、医療、技術)にとって有意義です。Whisperは、セルフホストまたはコスト管理が必要な場合により良い選択肢です。Naver Clovaは、韓国語のみのコンテンツで韓国市場向け製品を構築し、最もきめ細かい方言カバレッジを求める場合に適切な選択です。
APIの設定やインフラのデプロイなしでクリーンな韓国語文字起こしが必要なら、ConvertAudioToTextが話者ラベルとSRT/VTT書き出しを有料プランで提供し、開始用に登録時に一度だけ付与される10分間の無料文字起こしがあります。有料Proプランは月額9.99ドルで、対応するすべての言語で無制限の文字起こしが可能です。
韓国語の文字起こし結果を改善するヒント
- 言語コードを明示的に設定します。
koまたはko-KRにより、エンジンが言語検出に推論時間を費やすのを防ぎます。 - 韓国語の固有名詞のキーワードリストを提供します。이준호、박민서、김지원のような韓国語の名前にはそれぞれ妥当な代替ハングル表記があり、固定することで置換エラーを防げます。
- ブランド名や製品名については、韓国語のハングル表記と、話者が同じ意味で使う可能性のあるラテン文字版の両方を含めます。
- 背景雑音の少ない環境で録音します。韓国語の歯擦音(ㅅ、ㅆ、ㅈ、ㅊ)は周囲の雑音で明瞭さを失い、最も頻度の高い誤認識エラーを生み出します。
- 済州語話者の場合は、文字起こし前に期待値を設定します。専門エンジンを調達するか、人間によるポスト編集の予算を確保してください。
- 借用語部分について英語として正しく読める文字起こしが全体として正確だと仮定しないでください。ハングル部分を別途検証してください。
韓国語が同程度の難易度の言語と比べてどうかを比較するには、AIが低リソース言語で苦戦する理由と、CJKの並行例として日本語文字起こしガイドをご覧ください。
FAQ
Whisperは韓国語をうまく処理できますか?
はい。韓国語はWhisper Large-v3の学習データにおいて比較的充実している言語のひとつです。OpenAIは韓国語のベンチマークに単語誤り率(WER)ではなく文字誤り率(CER)を使用しています。韓国語の分かち書きは任意であり、WERは信頼性の低い指標になるためです。Large-v3モデルは、対応言語全体でLarge-v2より10~20%のエラー削減を示しています。明瞭な音声条件下での標準的なソウル韓国語では、Whisperは安定して動作します。地域方言、特に済州方言は大幅に難しくなります。
Otter.aiは韓国語の文字起こしに対応していますか?
いいえ。2026年半ば時点で、Otterが公式にサポートしているのは英語、スペイン語、フランス語、ドイツ語、日本語、中国語です。韓国語はこのリストに含まれていません。Otterの会議ボットアーキテクチャには韓国語のAI要約生成もありません。会議が韓国語の場合、現時点ではDeepgramまたはWhisperに対するファイルベースの文字起こしが現実的な方法です。
韓国語のAI文字起こしは敬語のスピーチレベルをどのように扱うべきですか?
正しい文字起こしは、話者の実際の語尾を単一のレジスターに正規化せずに再現します。音声中の하십시오체の語尾(-(으)ㅂ니다、-(으)십시오)は、テキストでも하십시오체として表示されなければなりません。韓国語の読者は、その語尾から話者間の関係を推測するため、これは重要です。WhisperもDeepgramも、発話された内容を正規化せずに文字起こしするため、スピーチレベルを正しく保持します。
韓国語の文字起こしで英語の借用語はどうなりますか?
その単語が完全に統合された韓国語の借用語か、生きた英語の用語かによって異なります。핸드폰(haendeupon、携帯電話)や카페(kape、カフェ)のような統合された借用語は、韓国人がそのように書くためハングルで返されます。OKR、PM、KPIのようなラテン文字の頭字語は、韓国語の慣習がそれを維持するためラテン文字のままです。英語のブランド名(ChatGPT、Google)もラテン文字のままです。これらのカテゴリーの境界は、一般的でない用語ではエンジンに依存することがあり、キーワードリストが役立つ場面です。
済州方言は単に韓国語の強いアクセントですか?
いいえ。済州語(제주어)は、ユネスコによって「方言」ではなく「深刻な危機に瀕した言語」に分類されている、韓国語から大きく分岐した変種です。標準現代韓国語にはない中世韓国語の特徴を保持しており、済州語に不慣れな本土の韓国語話者にとっては部分的または完全に理解不能です。標準韓国語で学習された汎用音声エンジンは済州語で大幅に失敗します。済州語の専用学習データを持つエンジン(例えばPersonaAIの韓国語ネイティブモデル。5万時間のコーパスの相当部分を地域音声に割り当てた)だけが信頼できる済州語の文字起こしを生成します。ワークフローに済州語コンテンツが含まれる場合は、人間によるレビューを見込んでおいてください。
情報源
- Deepgram: "Deepgram Expands Nova-3 with 11 New Languages Across Europe and Asia", https://deepgram.com/learn/deepgram-expands-nova-3-with-11-new-languages-across-europe-and-asia
- Deepgram: Models and Languages Overview, https://developers.deepgram.com/docs/models-languages-overview
- OpenAI Whisper Large-v3 release discussion, https://github.com/openai/whisper/discussions/1762
- AssemblyAI: Supported Languages documentation, https://www.assemblyai.com/docs/supported-languages
- Otter.ai pricing page, https://otter.ai/pricing
- Sonix pricing page, https://sonix.ai/pricing
- Naver Cloud Platform: CLOVA Speech product page, https://www.ncloud.com/product/aiService/clovaSpeech
- Google Cloud: Speech-to-Text pricing, https://cloud.google.com/speech-to-text/pricing
- PersonaAI Korean dialect speech model (The Asia Business Daily, 2026-01-15), https://www.asiae.co.kr/en/article/2026011515473523659
- Language Log: "The challenging importance of spacing in Korean", https://languagelog.ldc.upenn.edu/nll/?p=44437
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.