AI文字起こしは本当にプライベート?プロバイダーが実際にしていること
プライバシー文字起こしデータセキュリティ

AI文字起こしは本当にプライベート?プロバイダーが実際にしていること

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

ほとんどのAI文字起こしツールは、デフォルトで音声をAI学習に使わず、設定可能な自動削除を備え、転送中・保存中の両方で暗号化されているものを選べば、十分にプライベートです。しかしマーケティング文句は、最も重要な点——録音がAI学習データに戻されるかどうか——についてほぼ必ず曖昧です。この記事では、音声に実際何が起きるのか、プライバシーポリシーの読み方、そしてConvertAudioToTextが自社の取り組みについて保証する範囲としない範囲を解説します。

ほとんどのAI文字起こしツールは十分にプライベートですが、最も重要な区別——あなたの音声がモデル学習に使われるかどうか——は、ポリシーの細かな注釈に埋もれています。 ここでは、アップロードボタンを押した後に実際に何が起きるのか、そしてマーケティング用語を突き破る具体的な質問を紹介します。

アップロード後、あなたの音声に何が起きるのか

典型的なAI文字起こし処理には4つのデータ接点があり、それぞれ異なるリスク特性を持っています:

  1. ネットワーク経由のアップロード。 ファイルはデバイスから離れ、プロバイダーのサーバーへ送信されます。TLS/HTTPSがない場合、公衆Wi-Fiで盗み見される可能性があります。
  2. 処理中の保存。 AIモデルが処理している間、ファイルはディスク上に置かれます。ここで保存時の暗号化が重要になります。
  3. 処理後の保存。 ファイルは多くの場合、想像以上に長く残り、削除しない限り無期限に保持されることもあります。
  4. モデル学習。 一部のプロバイダーは、あなたの音声と文字起こし結果を学習データセットに投入します。

これらはどれもマーケティングページからは見えません。わかるのはプライバシーポリシーを読んだときです。

ConvertAudioToTextの音声アップロード画面。処理開始前のアップロードフローを示しています
ConvertAudioToTextの音声アップロード画面。処理開始前のアップロードフローを示しています

すべてのプロバイダーに問うべき質問

機密性の高い内容でサービスを検討しているなら、本当の答えを引き出せるのは次の質問です:

  • 転送中のファイルを暗号化していますか?(HTTPS/TLS:ほぼ常にイエス。最低限の水準です)
  • ストレージ上のファイルを保存時に暗号化していますか?
  • 処理後、音声をどのくらいの期間保持しますか?設定変更は可能ですか?
  • 顧客の音声をAIモデルの学習に使いますか?オプトイン方式ですか、オプトアウト方式ですか?
  • データ処理契約(DPA)はありますか?
  • サーバーはどこにありますか?EU内でのデータ保管(EUデータレジデンシー)を選べますか?
  • HIPAA対応可能で、BAAを締結できますか?(具体的なイエス/ノーで。「HIPAAの原則に従っています」では不可)
  • SOC 2監査を受けていますか?タイプ1ですか、タイプ2ですか?監査はいつ頃のものですか?
  • 情報漏えい発生時の通知ポリシーはどうなっていますか?

「プライバシーを真剣に考えています」「業界最高水準の暗号化」といった曖昧な回答は、回答なしとして扱うべきです。本物のプライバシー姿勢なら、一文ではっきり述べられるはずです。

モデル学習:多くの人が見落とすリスク

ここがプロバイダー間で最も大きく分かれるポイントであり、マーケティングが最も不透明な部分でもあります。

デフォルトでオプトインになっており、目立つ告知もないのが最悪のパターンです。 埋もれた設定を見つけて切り替えない限り、あなたの音声は学習データになります。AWS Transcribeはこれに該当します。AWSのドキュメントによれば、同サービスは「サービスの提供と維持、およびAmazon Transcribeとその他のAmazon機械学習/人工知能技術の品質向上と開発のためにのみ、本サービスが処理した音声入力を保存・利用することがある」とされています。AWS Organizationsのポリシーでオプトアウトできますが、能動的な設定が必要です。AWS Transcribe Medicalについては、ベンダーのドキュメントによると明示的にこの対象外です。

有料プラン限定でオプトアウトできるのが中間的なパターンです。 AssemblyAIはドキュメントによると、デフォルトで顧客の音声をモデル学習とベンチマークに利用することがあります。有料ユーザーはdata-opt-out@assemblyai.com宛てにメールすることでオプトアウトできます。無料ユーザーはオプトアウトできません。トライアル中の人は知っておくべき点です。

Otter.aiは、プライバシー・セキュリティページによると、独自の匿名化手法を使って非識別化した音声で学習を行っています。第三者のAIプロバイダーがOtterの顧客データで学習することは契約上禁止されています。ただし、Otter自身による一次学習利用をオプトアウトする設定はありません。

Descriptは「Share Data with Descript(Descriptとデータを共有)」という設定で明示的なオプトアウトを提供しています。この設定をオフにすると、あなたのプロジェクトはサービス改善に使われません。

Revは「お客様のコンテンツを外部のAIモデルの学習に使用することは決してありません」と明言しています。ただし自社独自の音声認識の改善には使用しており、これは「学習一切なし」という主張よりも狭い主張ですが、広範な第三者へのデータ共有とは意味のある違いがあります。

TurboScribeは、セキュリティFAQによると、顧客のメディアファイルや文字起こしテキストでAIや機械学習モデルを学習させないと明言し、文字起こしは自社所有のマシン上で社内処理しているとしています。

Fireflies.aiは包括的な方針を掲げています:「個人情報をAIモデルの学習に使用せず、ベンダーに対してもこの情報を自社のモデル学習に使わないよう契約で禁止しています」。さらに、第三者ベンダーとの会議コンテンツについてはゼロデータ保持ポリシーを主張しています。

OpenAIのWhisper API:OpenAIのデータに関するドキュメントによると、APIへの入力はデフォルトでは学習に使用されません。Whisperの音声文字起こしエンドポイントはゼロデータ保持の対象となり、短い不正利用モニタリング期間であっても音声は保持されません。このオプションには適格性の審査承認とエンタープライズアカウントの設定が必要です。

3つの姿勢を最悪から最良の順に並べると:

姿勢意味
デフォルトでオン、オプトアウトは埋もれているAWS Transcribe(標準)組織ポリシーを設定しない限り、音声がモデル学習に使われる
デフォルトでオン、オプトアウトは申請制AssemblyAI(有料プラン)メールでオプトアウト。無料ユーザーは不可
顧客音声の学習なしTurboScribe、Fireflies、OpenAI APIコンテンツが学習セットに入ることはない

ConvertAudioToTextはあなたの音声をどう扱うのか

公開中のプライバシーポリシーに沿って、平易にまとめると:

転送中のファイル: ブラウザから当社サーバーまでTLS/SSLで暗号化されます。

保存中のファイル: Cloudflare R2にプロバイダー側の暗号化付きで保存され、アクセスには認証が必要です。

保持期間: 音声の保持はユーザーが管理できます。デフォルトでは、アップロードされた音声・動画ファイルは、保持を選択しない限り文字起こし直後に自動削除されます。無料プランで保持を選択した場合も、7日以内に自動削除されます。文字起こしテキストはアカウント内で非公開に保たれ、ダッシュボードからいつでも削除できます。アカウントを削除すると、関連するすべてのデータが30日以内に削除されます。それぞれの設定が適切な場面については、文字起こしファイルの自動削除ガイドをご覧ください。

モデル学習: プライバシーポリシーに基づき、お客様のコンテンツはAI/MLモデルの学習に使用されず、第三者に販売または譲渡されることはなく、広告にも使用されません。音声は、サブプロセッサーとして働く第三者の音声認識エンジンによって処理されます。これらのサブプロセッサーはプライバシーポリシーに記載されています。

HIPAAとSOC 2: 当社はデフォルトではHIPAA認証を受けておらず、標準プランにBAAは含まれません。BAA、SOC 2証明、VPC分離デプロイメントは、カスタムエンタープライズプランとして対応範囲に含めることができます。標準プランでPHI(保護医療情報)を扱う医療チームは、代わりに署名済みBAAのあるHIPAA対応プロバイダーを使用すべきです。HIPAA準拠の文字起こしをご覧ください。

DPA: 法人のお客様はリクエストに応じて提供します。

これが正直な答えであり、上で他のベンダーに求めたのと同じ具体性のレベルで述べたものです。

プライバシーポリシーの読み方:マーケティング用語デコーダー

さらなる質問を引き出すべきマーケティング用語:

  • 「業界最高水準の暗号化」: 転送時のTLSを指すだけです。どのプロバイダーでもやっています。保存時の暗号化と鍵管理は別途尋ねましょう。
  • 「お客様のデータは販売されません」: 学習については何も述べていません。「販売しない」と「モデル学習に使う」は両立する表現です。
  • 「銀行レベルのセキュリティ」: 通常は保存時のAES-256を指します。これも最低限の水準です。
  • 「データを削除します」: いつ?何がトリガー?自動か手動か?デフォルトは?
  • 「GDPR準拠」: EU内データ保管のこと?DPAの締結?対応期限(SLA)付きの削除権?どの具体的な義務を満たしているのか尋ねましょう。
  • 「SOC 2認証取得」: タイプ1かタイプ2か?監査報告書は古くないか?請求すれば入手できるか?

これらへの本当の答えは短いものです。返信が具体性のない安心させる文章の段落なら、具体的な答えはおそらく「ノー」です。

コンプライアンス認証:実際に何がわかるのか

これらをどう評価すべきかについての補足:

SOC 2タイプII(タイプIではなく)は、独立した監査人が一定期間(通常6〜12か月)にわたり実際の統制を審査したことを意味します。タイプIは特定時点のスナップショットです。Rev、Otter(ドキュメントによる)、Descript、Happy ScribeはいずれもSOC 2タイプIIを主張しています。

HIPAA対応可能性は、ツール単体で獲得できる認証ではありません。デプロイメントの属性に、署名済みの業務委託先契約(Business Associate Agreement、BAA)が加わったものです。Otterは2025年半ばにHIPAA準拠を追加し、Enterpriseプランで署名済みBAAとともに利用可能になりました。RevはエンタープライズプランでHIPAAを提供しています。FirefliesはHIPAA対応を主張しています。AWS Transcribe Medicalは、AWSのより広範なBAAのもとでHIPAA対応可能です。

BAAがあなたの具体的なユースケースをカバーしていなければ、「HIPAA準拠」という包括的な主張に大きな意味はありません。問うべき質問はこうです:「BAAに署名してもらえますか?そのBAAは音声処理をカバーしますか?」

GDPR準拠も同様に関係性の問題です。正しい質問は次のとおりです:DPAを提供していますか?データはどこで処理されますか?削除請求に応じますか?その場合の期限は?EUから米国への移転についてSCC(標準契約条項)は整備されていますか?

各規制が実際に何を求め、ベンダーに何を尋ねるべきかについて詳しくは、GDPR準拠の文字起こしをご覧ください。

自動削除:思っている以上に重要な理由

文字起こしサービスで最も一般的なパターンは、音声を「ユーザーが削除するまで」保持することです。ユーザーフレンドリーに聞こえますが、実際は逆です。ファイルは、あなたが片付けるのを思い出すまで無期限に置かれたままになります。そしてほとんどの人は思い出しません。

自動削除はリスク期間に上限を設けます。ファイルには生存期間があり、意図的に保持を選ばない限り自動的に消えます。これは、露出期間こそが主なリスクとなる機密性の高いコンテンツにとって最も重要です。

プロバイダーを評価するときは尋ねましょう:自動削除は選択肢としてあるのか、それとも手動削除まですべて残るのか。デフォルトはどうなっているのか。ジョブごとに設定できるのか、アカウント全体でしか設定できないのか。

SaaSプロバイダーが正解にならないとき

一部の録音については、プロバイダーのポリシーにかかわらず、クラウドサービスは適切ではありません:

  • 政府の機密資料
  • 第三者が関与するだけで特権が破れる弁護士・依頼者間の秘密特権対象の会話
  • BAAを利用できない場合の医療PHI
  • 流出すると実際の害につながりうる個人セラピーの録音
  • 具体的な契約上のデータ取扱い義務を伴う機密性の高い事業戦略

こうしたケースでは、Whisperをローカルで実行することが唯一完全にプライベートな選択肢です。セットアップには技術的な手間がかかり、精度は最新のクラウドホスト型モデルより劣りますが、たまにある重要度の高い録音のためならそのトレードは価値があります。実用的な比較については、オンデバイス vs クラウド文字起こしをご覧ください。

意思決定フレームワーク

音声に何が含まれているかが、プロバイダーに何を求めるべきかを決めるべきです:

コンテンツの種類最低要件
公開コンテンツ(ポッドキャスト、講義)どのプロバイダーでも可。プライバシーリスクは低い
社内業務(チームミーティング、戦略)デフォルトで音声を学習に使わないこと。自動削除があること
クライアント/顧客との会話DPA必須。音声の学習なし。明確な保持ポリシー
医療PHI署名済みBAAのあるHIPAA対応プロバイダー
機密または法的特権対象セルフホストのみ

ConvertAudioToTextは最初の3つをカバーします。HIPAA対応やセルフホストのケースはカバーしておらず、そのことは率直にお伝えします。

弁護士やジャーナリストのワークフローが具体的に何を必要とするかについては、文字起こしと弁護士依頼者特権文字起こしと守秘義務契約をご覧ください。

法務・コンプライアンス面での補足:この記事の内容は法的助言ではありません。GDPR、HIPAA、特権に関する義務は管轄区域や具体的なデプロイメントによって異なります。要件については法律の専門家にご確認ください。

FAQ

AI文字起こしは私の音声を永久に保存するのですか?

プロバイダーと設定によります。多くのサービスは、手動で削除しない限り音声を無期限に保持します。一定期間後の自動削除に対応しているサービスもあります。ConvertAudioToTextのように、ユーザーが保持期間を設定でき、処理後すぐに削除したり、一定期間後に削除したりできるサービスもあります。必ずデフォルトの保持期間と、それを短縮できるかどうかを確認してください。

文字起こしサービスは私の音声をAIの学習に使うのですか?

複数のサービスが、少なくともデフォルトでは行っています。AWS Transcribe(標準プラン)は、組織のオプトアウトポリシーを設定しない限り、サービス改善のために顧客の音声を使用します。AssemblyAIはデフォルトで学習利用を許可しており、有料ユーザーは申請によりオプトアウトできます。Otterは独自の手法で非識別化した音声で学習しています。TurboScribeとFirefliesは顧客の音声で学習しないと明言しています。OpenAIのWhisper APIはデフォルトでは音声を学習に使いません。機密性の高いコンテンツに使うプロバイダーについては、必ず個別のポリシーを確認してください。

「転送中の暗号化」と「保存時の暗号化」の違いは何ですか?

転送中の暗号化とは、音声がデバイスからプロバイダーのサーバーへ移動する間、保護されていることを意味します。保存時の暗号化とは、ファイルがストレージにある間、暗号化されていることを意味します。どちらも重要です。転送中の暗号化は公衆ネットワークでの傍受を防ぎます。保存時の暗号化は、ディスクを盗まれてもファイルが漏えいしないことを意味します。評判の良いプロバイダーのほとんどは両方行っていますが、特に保存時の暗号化と復号鍵を誰が管理しているかは確認する価値があります。

文字起こしツールは「HIPAA準拠」なのですか?

単体でHIPAA準拠となるツールは存在しません。HIPAA準拠はデプロイメントの属性であり、保護医療情報(PHI)の具体的な処理をカバーする業務委託先契約(BAA)を組織とベンダーの間で締結する必要があります。Rev(エンタープライズプラン)、Otter(BAA付きEnterprise)、Firefliesなど、一部のプロバイダーはBAAを提供しています。AWS Transcribe Medicalは、AWSのより広範なBAAのもとでHIPAA対応可能です。必ず「HIPAA準拠」という主張だけでなく、BAAそのものを求めてください。

音声に弁護士依頼者特権の対象となる内容が含まれている場合はどうすればよいですか?

核心的な問題は、音声を第三者のSaaSに送ることが特権を破るかどうかです。多くの管轄区域では、適切な契約を結んだ承認済みサブプロセッサーの利用は特権を破りませんが、これは管轄区域固有の問題であり、所属する弁護士会の指針によります。最低限、ベンダーの役割を処理者として正式化するDPAを要求し、ベンダーがコンテンツを学習に使わないことを確認し、削除ポリシーを確かめてください。最も重要度の高い録音については、ローカル文字起こしがこの問題を根本的に回避します。特権対象の資料をクラウドサービスにアップロードする前に、必ず所属弁護士会の倫理指針に相談してください。

文字起こしプロバイダーが自分のデータを実際にどう扱っているかを確認するには?

DPA(プライバシーポリシーだけでなく)、SOC 2タイプII報告書(過去12か月以内の日付のもの)、そして学習に関する質問への直接的な書面回答を、信頼・法務チームの担当者から求めてください。これらのいずれかが入手できない場合、または学習に関する質問への回答がイエス/ノーではなくマーケティング文の段落である場合は、ギャップ(欠落)として扱いましょう。明快な答えを持つプロバイダーは、すぐにそれを提示してくれます。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles