文字起こしのためのデータレジデンシー:音声データはどこにあるのか
データレジデンシーコンプライアンス文字起こし

文字起こしのためのデータレジデンシー:音声データはどこにあるのか

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

文字起こしサービスに音声をアップロードすると、ベンダーのマーケティングが「EUデータレジデンシー」を掲げていても、通常は米国のデータセンターで処理されます。現在、保存も処理も欧州域内にとどまる本物のEUエンドポイントを提供しているプロバイダーはごくわずかで、Deepgram、AssemblyAI、Google Cloud STT、Happy Scribeなどがその例です。レジデンシー(データが物理的にどこにあるか)は主権(どの管轄裁判所がアクセスを強制できるか)とは同じではなく、保存と処理の分断こそがベンダーの主張で最もよく見られる落とし穴です。

アップロードボタンを押すと、音声ファイルは通常、数ミリ秒のうちに米国のデータセンターへ送られます。文字起こしモデルはそこで実行され、文字起こし結果もそこで書き出され、その結果があなたのもとへ返されます。「EUデータレジデンシー」は多くのベンダーのマーケティングページで目立つように謳われていますが、その主張と実際のデータフローとの間には、しばしば大きな隔たりがあります。

本記事では、主要プロバイダーにおいて音声が実際にどこへ流れるのかを整理し、レジデンシーと主権を切り分けるとともに、レジデンシーが本当に重要になるケースと、チームが一度も見直したことのない継承されたポリシー要件にすぎないケースを解説します。

レジデンシー、主権、ローカライゼーションは同じものではない

次の3つの概念は混同されがちです:

データレジデンシーとはデータの物理的な所在地のことです。どの国のサーバー上に置かれているかを指します。

データ主権とはそのデータに対する法的管轄権のことです。どの裁判所が開示を強制できるかを意味します。フランクフルトにデータを保存している米国企業でも、米国CLOUD法の命令には応じる義務があります。主権管理を伴わないEUレジデンシーは一方の懸念には対応しますが、もう一方には対応しません。

データローカライゼーションとは、特定カテゴリーのデータを特定の国内にとどめなければならないと定める法定要件のことです。ロシアの連邦法242-FZや中国のPIPLには本物のローカライゼーション要件が含まれています。GDPRにはそれがなく、規制しているのは移転であって所在地ではありません。

ほとんどの文字起こしコンプライアンスの議論では、レジデンシーが運用上の問いであり、主権はより難しい法的な問いであり、ローカライゼーションは一部の政府契約や重要インフラ契約がグローバルクラウドプロバイダーにとって全面的に手が出せない理由となっています。

GDPRが実際に求めていること

GDPRはEU域内のみでの保存を義務付けていません。求めているのは、EEA外への個人データの移転がすべて適法な移転メカニズムによってカバーされることです:

  • EU十分性認定:欧州委員会は一定の保護水準を備えると認めた国を指定しています。現在のリストには英国(ブレグジット後)、スイス、日本、韓国、イスラエル、ニュージーランドなどが含まれます。これらの国へは追加の手続きなしにデータを移転できます。

  • EU-USデータプライバシーフレームワーク(DPF):Schrems II判決でプライバシーシールドが無効化されたことを受け、2023年7月に発足しました。米国プロバイダーはDPFの下で自己認証でき、認可された移転先となります。このフレームワークは最初の司法的挑戦(2025年9月)を乗り切りましたが、圧力は続いており、2026年6月時点でNOYBは最近の米最高裁判決を踏まえた見直しの開始を欧州委員会に要請しています。CJEU(欧州連合司法裁判所)は別の挑戦について2026年末から2027年初頭にかけて判断を下す見込みです。DPFは現時点で有効なメカニズムですが、恒久的に安定するとは限りません。

  • 標準契約条項(SCC):欧州委員会が事前承認した契約テンプレートです。新規契約には2021年版SCCの使用が必須で、条項そのものに加えて移転影響評価(TIA)が求められます。

  • 拘束的企業規則(BCR):多国籍グループ向けの内部的な拘束的ルールで、データ保護当局の承認を必要とします。手続きは長期に及び、主に非常に大規模な組織が利用します。

多くのEU組織は、GDPRの要求を超える内部のEUレジデンシーポリシーを採用しています。それは正当なポリシーの選択ですが、その要件がベンダー選定を左右する前に、それが法的義務なのか内部のデフォルト設定なのかを確認しておく価値があります。

本記事は情報提供のみを目的としたものであり、法的助言ではありません。GDPRコンプライアンスに関する意思決定については、弁護士にご相談ください。

文字起こしプロバイダーは実際どこで音声を処理しているのか

保存と処理の分断こそ、「EUデータレジデンシー」を謳う主張の大半が崩れるポイントです。プロバイダーは文字起こし結果をEUのデータセンターに保存しながら、実際の推論ワークロードを米国のGPUクラスターへ振り分けることができます。この2つは同じものではありません。

以下の表は、2026年7月時点で私がベンダーのドキュメントと照らして確認できた内容の一覧です。「ベンダードキュメントによる」と記載されたセルは、当該側面について具体的な公開声明を見つけられなかったケースを示します。

ベンダーEU保存EU処理呼び出し方法備考
Deepgramはいはいapi.eu.deepgram.comGA。STT、TTS、Voice Agent、Text Intelligenceすべて対応
AssemblyAIはいはいapi.eu.assemblyai.com音声+文字起こしデータはEU外に出ない。ISO 27001 + SOC 2 Type 2取得
Google Cloud STTはいはいEUリージョンエンドポイント(例:europe-west2)保存中・処理中のデータはリージョン内に保持。完全なレジデンシー管理にはV2 APIが必要
AWS TranscribeはいはいEUリージョンのエンドポイントを指定(フランクフルト、アイルランド、ロンドン)データは選択したリージョン内にとどまる。AWS標準のEU商用リージョン
Happy Scribeはいはいデフォルト(EUネイティブ企業)EUデータセンター、Tier IV、ISO 27001
Trintはいベンダードキュメントによるアカウントレベルでリージョンを選択EUまたはUSの保存(AWSホスト)。businessティア
Fireflies.aiはい(Enterprise)いいえ(米国)Enterprise Private StorageEU保存は利用可能。ただし処理は依然として米国内。厳格なレジデンシー要件では重大なギャップ
Otter.aiいいえいいえ文書化された手段なしAWS us-east-1。EUからの移転にはSCCを使用。EUリージョンオプションなし
Rev.comいいえいいえエンタープライズ向けオンプレミスデフォルトはUSホスト。規制対象のエンタープライズユースケース向けにオンプレミス導入が可能
DescriptベンダードキュメントによるベンダードキュメントによるDPAは要問合せリージョンに関する公開声明は確認できず。DPAとサブプロセッサーリストを請求すること
OpenAI Whisper APIはい(対象アカウント)はい(対象アカウント)API PlatformのEU Projectリージョン対象資格の確認が必要。新しいモデルでは約10%の価格上乗せ。SCCはAPI規約による

Firefliesの行は掘り下げる価値があります。同社はナレッジベースの中で、Private Storageを利用するEnterprise顧客のデータは「EUに保存されるが、米国で処理される」と明言しています。これはEU主権やEU処理を伴わないEUレジデンシーです。懸念が推論時の露出、つまりモデルが音声を目にすることにある組織にとって、これでは問題は解決しません。

文字起こし処理の前にファイルをCloudflare R2へアップロードするConvertAudioToTextの音声アップロードツール
文字起こし処理の前にファイルをCloudflare R2へアップロードするConvertAudioToTextの音声アップロードツール

実態を見抜く7つの質問

マーケティングページは、何が実際にEU内にとどまるのかを明示しないまま「EUデータレジデンシー」を謳うことが常です。ベンダーを評価する際は、以下について書面での回答を求めましょう:

  1. アップロードはどこで終端しますか? 一部のプロバイダーはアップロードをグローバルエッジで終端させた後、中央の処理リージョンへルーティングします。

  2. 音声はどこで処理されますか? AIモデルは保存場所とは別のリージョンで実行される場合があります。EUのストレージに置かれた音声が米国のモデルへ送られるなら、厳格なレジデンシー要件は満たせません。

  3. 文字起こし結果はどこに保存されますか? 音声はリージョン内にあっても、文字起こし結果が米国の中央カタログへ同期されるケースがあります。

  4. バックアップはどこにありますか? バックアップは災害復旧のためにリージョンをまたぐことが多く、レジデンシーのコミットメントで見落とされがちです。

  5. ログとメタデータはどこにありますか? ファイル名やコンテンツの一部を含むアプリケーションログだけで、レジデンシー要件を満たせなくなることがあります。

  6. どのサブプロセッサーが対象になりますか? 米国拠点のAIモデルをサブプロセッサーとして使う文字起こしプロバイダーは、あなたの音声をそのサブプロセッサーの管轄区域へ渡すことになります。

  7. あなたの音声はモデル学習に使われますか? 使われる場合、学習インフラの所在地もレジデンシーの全体像の一部です。

7つすべての質問に対して、各ステップごとの具体的なリージョン名を挙げて答えるベンダーは、本物のレジデンシー主張をしています。そこまでの詳細なく「EUレジデンシーに対応しています」とだけ答えるベンダーの主張は曖昧です。

さらに、現行のDPA、所在地付きのサブプロセッサーリスト、越境移転に使われるメカニズム(DPF認証番号、SCCの確認、または十分性認定の根拠)の提示も求めましょう。ベンダーを再評価する際には自社の記録も更新してください。これらのメカニズムは固定ではありません。

レジデンシーが実際に重要になる場面

レジデンシー需要が高い: 主権要件のある公共部門の契約。ローカル保存ルールがある管轄区域の医療データ(ドイツ病院未来法の下でのドイツの医療データ、HDSフレームワークの下でのフランスの医療データ)。ECBまたは各国規制当局の監督下にある金融サービス。防衛および政府関連の請負業者。重要インフラ事業者。

レジデンシー需要が中程度: 法的義務がなくてもEU保存を求める内部データポリシーを持つEUのB2B顧客。厳格な調達要件を持つ多国籍顧客。GDPRの基準を超える業界固有のデータ保護ルールがある業界。

レジデンシー需要が低い: 特別なコンプライアンス体制のない大半のB2B SaaS。一般向けコンテンツ(ポッドキャスト、カンファレンス収録)。機密性のない社内チームコミュニケーション。個人のボイスメモ。

低いカテゴリーに属する場合、レジデンシーは実際には好みであるのに必要と提示されることがよくあります。それがハードな要件なのか、引き継がれた調達のデフォルト設定なのかを法務チームに確認しましょう。

越境移転メカニズム(DPF、SCC、BCRのいずれであっても)については、自社の特定のベンダーとデータフローに対して移転影響評価(TIA)が必要かどうかを確認してください。2021年版SCCではTIAが必須ですが、このステップを省略する組織は少なくありません。

主権のギャップ

レジデンシーだけではCLOUD法には対処できません。Clarifying Lawful Overseas Use of Data Act(CLOUD法)の下で事業を行う米国企業は、EUのデータセンターに保存されたデータを含む、世界中のどこに保存されたデータであっても提出を命じられる可能性があります。英国のCrime (Overseas Production Orders) Actの下では、英国企業にも同じことが当てはまります。

ほとんどの商用文字起こしユースケースでは、これは理論上の懸念です。しかし政府契約、防衛業務、国家アクターによるアクセスが現実の脅威モデルとなる状況では、主権管理を伴わないレジデンシーでは不十分です。

文字起こしにおける現実的な主権の選択肢は限られています。自社の管轄区域内でのセルフホストインフラ、あるいは信頼できる管轄区域の法律のみに服し、相反する外国諜報機関の義務を負わないプロバイダーです。実際には、これはEUのみのインフラを持ち、米国の親会社を持たないEU本籍のプロバイダーを意味します。Happy ScribeとVerbit(特定のエンタープライズ構成の場合)は、EUエンドポイントを持つ米国本籍のクラウドプロバイダーよりも、このプロファイルに適合します。

厳格な要件のためのセルフホスティング

本当に譲れないレジデンシーに加えて主権も求められる場合、オープンウェイトモデルのセルフホスティングが最も防御力のある道です。OpenAIのWhisperモデル(large-v3)はオープンウェイトとして入手でき、自社の管轄区域内の自社ハードウェアに展開できます。

トレードオフは現実的です:

  • 実用的な速度にはGPU推論が必要です。Whisper large-v3はA100 GPUでおよそリアルタイムの2〜3倍の速度で動作します。
  • 本番環境への導入にはインフラ運用、スケーリング、モデル更新の保守が必要です。
  • 手に入るのはモデルであってサービス層ではありません。話者分離(diarization)、整形、専門用語の精度はいずれも追加の作業が必要です。
  • コストは使用量ではなく計算量に比例するため、散発的な利用よりも大量かつ継続的なワークロードに向いています。

レジデンシー需要が低〜中程度の組織にとって、セルフホスティングは通常過剰です。厳格な国内調達命令の下で大量のデータを処理する規制対象企業にとっては、監査可能な唯一の選択肢であることが多いのです。

EU拠点のマネージドサービスの中には、EUインフラ上でWhisperを実行し、クラウドの手軽さと完全なセルフホスティングの中間の道を提供するものがあります。そうしたサービスは存在しますが成熟度はまちまちです。前述の7つの質問を同じくドキュメントに対して評価してください。

監査証跡の維持

レジデンシーが重要な文字起こし作業では、次の記録を残しておきましょう:

  • ベンダー名と、DPAに記載された具体的なレジデンシーコミットメント(バージョンと日付)
  • 越境移転のメカニズム(DPF認証ID、SCCの確認)
  • サブプロセッサーリストとそれぞれの所在地(日付入り)
  • 自社の保持期間と自動削除の設定
  • 上記を最後に確認した日付

コンプライアンス監査で「なぜそのベンダーを選んだのか」「継続的なコンプライアンスをどう確保しているのか」と問われたとき、この記録がその答えになります。これがなければ、技術的に正しい選択でさえ場当たり的に見えてしまいます。

レジデンシー管理は、明確な文字起こしファイルの自動削除と組み合わせ、暗号化と文字起こしツールの姿勢も見直してください。保存時および転送時の暗号化は基本であり、レジデンシーが代替できるものではありません。

ConvertAudioToTextが提供するもの、提供しないもの

完全な透明性のために申し上げると、ConvertAudioToTextは現在、グローバルに分散したインフラ上で稼働しています(ストレージはCloudflare R2、文字起こしはAssemblyAIとDeepgramのサブプロセッサー経由で処理)。現時点で、音声と文字起こし結果がエンドツーエンドでEU域内にとどまることが保証された、認証済みのEU専用レジデンシーオプションは提供していません。

提供しているのは:転送時のTLS暗号化、保存時のサーバーサイド暗号化、ユーザー音声をAI学習に使わないポリシー、ユーザーが設定できる自動削除、ビジネス顧客向けのリクエストに応じたDPAです。

要件が「いかなる状況でも音声をEU外に出してはならない」であれば、現時点では適していません。サインアップの手間なく素早くきれいな文字起こし結果が必要で、強固なデータ最小化の実践を重視するチームには、ConvertAudioToTextが明確なデータ取り扱いポリシーと併せてうまく機能します。より包括的なプライバシー姿勢についてはAI文字起こしはプライベートかを、GDPR固有のガイダンスについてはGDPR準拠の文字起こしをご覧ください。

導入前に実践的なチェックを

ほとんどのチームは、根拠となる規制を精査しないままレジデンシー要件を過剰に詳細化しています。より高額または制約の多いプロバイダーに絞り込む前に、次の点を確認しましょう:

  • このデータに対してレジデンシーを具体的に義務付けている規制は何ですか?
  • すべてのデータに適用されるのか、それとも特定カテゴリー(医療データ、金融データ、GDPR第9条の特別カテゴリーデータ)のみなのか?
  • それは法定要件なのか、更新可能な内部ポリシーなのか?
  • 利用可能な移転メカニズム(DPF、TIA付きSCC、十分性認定)は自社のリスク姿勢に対して十分か?

一部のチームにとっては厳格なレジデンシーは譲れず、上記すべてへの答えも明らかです。しかし予想以上に多くのチームにとって、その要件は最新の規制ガイダンスと照らして見直されていない内部のデフォルト設定であり、法的リスクを負うことなく緩和できるものです。

正しい文字起こしプロバイダーは、引き継いだテンプレートではなく、本当の義務によって決まります。

FAQ

GDPRは文字起こしデータをEU域内に保存することを義務付けていますか?

いいえ。GDPRはEU域内のみでの保存を一律に義務付けているわけではありません。求めているのは、EEA(欧州経済領域)外への個人データの移転が適法なメカニズムによって担保されていることです。具体的には、移転先国に対するEUの十分性認定、標準契約条項(SCC)、拘束的企業規則(BCR)、またはEU-USデータプライバシーフレームワーク(DPF)による認証です。多くのEU組織は、GDPRが実際に義務付ける内容よりも厳しい内部のEUレジデンシーポリシーを設けています。自社の要件が法的義務なのか内部ポリシーなのかを確認しましょう。

データレジデンシーとデータ主権の違いは何ですか?

レジデンシーは物理的な所在地の問題、つまりデータがディスク上のどこにあるかという問題です。主権は法的な問題、つまりどの国の裁判所がそのデータへのアクセスを強制できるかという問題です。米国本籍の企業は、フランクフルトのAWSデータセンターに音声を保存(EUレジデンシー)しながら、米国CLOUD法の命令には従う義務があります(米国主権)。この区別は高機密性のワークロードでは重要です。主権管理を伴わない純粋なEUレジデンシーは前者の懸念には対応しますが、後者には対応しません。

EU保存だけでなく真のEU処理を提供している文字起こしサービスはどれですか?

2026年半ば時点では、Deepgram(api.eu.deepgram.com、GA、主要STTエンドポイントすべて)、AssemblyAI(api.eu.assemblyai.com、音声および文字起こしデータはEU内にとどまる)、Google Cloud Speech-to-Text V2(EUリージョンエンドポイント、保存中・処理中のデータともにリージョン内に保持)。Happy ScribeはデフォルトでEUネイティブです。Fireflies.aiはEnterprise顧客向けにEU保存を提供しますが、処理は依然として米国内で行われます。Otter.aiには文書化されたEUオプションがありません。TrintはEUまたはUSの保存を選択できます(businessティア、AWSホスト)。AWS TranscribeはEUリージョン(フランクフルト、アイルランド、ロンドン)で利用可能で、データは指定したリージョン内にとどまります。

レジデンシーの観点から、Whisperのセルフホスティングが正解となるのはどんな場合ですか?

オープンウェイト版Whisper(large-v3)のセルフホスティングが理にかなうのは、レジデンシーが本当に譲れない要件であり、自社の管轄区域内でその要件を満たすクラウドプロバイダーが存在しない場合です。公共部門、防衛関連企業、国内調達限定の調達要件などでよく見られます。トレードオフは現実的です:GPU推論、モデル保守、スケーリング、運用オーバーヘッド。たまに扱う機密録音であれば、通常は過剰です。月に数千時間を処理し、スタック全体にわたる正式な監査証跡が必要な規制対象企業にとっては、セルフホスティングまたはオンプレミス型ベンダー導入(Revがエンタープライズ向けに提供)の方が防御力のある選択肢となります。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles