AIツール2026年10月更新

ChatGPTで音声ファイルの文字起こし・要約が可能に|対応形式・512MB上限・対象プラン・精度の注意点【2026年10月】

公開日: 2026/10/09
ChatGPTで音声ファイルの文字起こし・要約が可能に|対応形式・512MB上限・対象プラン・精度の注意点【2026年10月】

この記事のポイント

ChatGPTは2026年10月6日から、有料プランで音声ファイルを添付して文字起こし・要約・内容への質問ができるようになりました。対応形式、512MBが何時間分か、プラン別の可否、上がらないときの確認点、精度と情報管理の注意点を公式ヘルプをもとに整理します。

ChatGPTは2026年10月6日(公式リリースノートの日付)から、録音済みの音声ファイルを会話に添付して、文字起こし・要約・内容への質問ができるようになりました。使えるのは有料プランとワークスペースで、Freeプランは現時点で対象外です。1ファイルの上限は512MBです。

国内では10月8〜9日にギズモード・ジャパン、Impress Watch、ITmediaなどが報じています。検索上位には「ChatGPTでは音声ファイルを文字起こしできない」と書いた2026年5〜8月ごろの記事がまだ残っていますが、今は状況が変わりました。

この記事でわかること

  • 音声ファイルのアップロードでできること、できないこと
  • 対応形式と、512MBが録音何時間分にあたるかの目安
  • プラン別に使えるかどうか(Free・Go・Plus・Pro・Business・Enterprise)
  • アップロードできないときの確認点
  • 文字起こしの精度と、会議録音を上げる前の情報管理
  • ChatGPT Record・Meetingsプラグイン・Voice・APIとの使い分け

こんな人に向けた記事です

  • 会議・インタビュー・講義の録音をChatGPTで文字にしたい人
  • 「ChatGPT 文字起こし できない」と調べて、最新の状況を確かめたい人
  • 社内で使ってよいか、どのプランで使えるかを判断したい人

ChatGPT全体の機能やプランの基本はChatGPTとは?にまとめています。

有料プランなら、録音ファイルをそのまま文字起こし・要約できる

項目

現時点の内容(2026年10月10日時点)

提供開始

2026年10月6日(公式リリースノート)

できること

文字起こし、要約、録音の中身への質問、議事メモ・送付メールの下書き作成

対象

有料のChatGPTプランとワークスペース(Enterpriseを含む)。Freeは対象外

1ファイルの上限

512MB。録音時間の上限は公式に書かれていない

対応形式

WAV、MP3/MPEG、OGG/OGA、音声のみのWebM、PCM、FLAC、AAC、M4A、音声のみのMP4

使える環境

Webと対応モバイルアプリ(ワークスペース設定・地域・アプリのバージョン・モデルで変わることがある)

精度

誤りが出ることがあり、話者の識別は当てにならないことがある(公式)

追加料金

公式に追加料金の記載はない

公式リリースノートは、機能の中身を次のように説明しています。

Upload audio files to ChatGPT to create transcripts, summarize recordings, and ask questions about their contents. You can turn a meeting, interview, or lecture into structured notes or a follow-up email draft.

出典:ChatGPT Release Notes(OpenAI Help Center)

「文字起こし専用ツール」というより、録音を読み込ませて、そこから要約やメモ、メール下書きまで作らせる機能です。録音を聞き返さずに「あの会議で納期について何と言っていたか」を確かめる、といった使い方ができます。

音声ファイルでできること・できないこと

できることは、公式ヘルプ「Uploading files and audio to ChatGPT」に挙がっている使い方がそのまま目安になります。一方で、専用の文字起こしサービスが持つ機能のいくつかは、公式に対応の記載がありません。

公式が挙げている使い方

  • 会議の録音を要約し、決定事項・未決事項・次のアクションに分ける
  • 「発売時期について何と言っていた?」のように、録音の中身を質問する
  • インタビューや講義から、要件・具体例・要点を抜き出す
  • 先に文字起こしを出させ、それをもとに追加で質問する
  • 録音を構造化したメモ、会議の振り返り、送付用メールの下書きにする

できない、または公式に書かれていないこと

項目

状況

Freeプランでの利用

できない(現時点)

動画と判定されたMP4・WebM

アップロードできない。音声だけのファイルにする必要がある

512MBを超えるファイル

アップロードできない

長時間録音の確実な処理

保証なし。処理はベストエフォートで、とても長い録音はタイムアウトすることがある

話者の正確な区別

当てにならないことがある(公式)

タイムスタンプ付き・字幕形式(SRTなど)の出力

公式に記載なし(未確認)

リアルタイム録音

この機能の役割ではない。その場で録るならChatGPT Recordなど別の機能

使われている文字起こしモデル

非公開。「Whisperで処理」とする報道もあるが、公式の裏付けはない

「ChatGPTの文字起こし結果をそのまま字幕ファイルにしたい」「誰が何を言ったかを正確に残したい」という用途には、現時点では向きません。

対応形式と512MBの上限:何時間の録音まで上げられるか

OpenAI Developersのファイル入力ガイドのタイトル画像

出典: OpenAI Developers「File inputs」

対応形式はWAV・MP3・M4Aなど主要な音声形式をほぼ押さえています。iPhoneのボイスメモ(.m4a)はそのまま上げられます。注意したいのは、録音時間ではなくファイルサイズ(512MB)で上限が決まる点です。

対応形式の一覧(公式ヘルプ)

形式

補足

WAV

非圧縮のためサイズが大きくなりやすい

MP3 / MPEG

一般的な圧縮形式

OGG / OGA

—

WebM

音声のみのもの。動画と判定されると不可

PCM

—

FLAC

可逆圧縮

AAC

—

M4A

iPhoneのボイスメモなど

MP4

音声のみのもの。動画と判定されると不可

公式ヘルプには「ファイルに正しくデコードできる音声ストリームが含まれている必要がある」とも書かれています。拡張子だけ変えたファイルや、破損したファイルは読み込めません。

512MBは録音何時間分か(計算上の目安)

公式は録音時間の上限を示していません。次の表はビットレートから単純計算した目安で、公式値ではありません。

形式・音質

1分あたりのサイズ

512MBに収まる長さ

M4A(AAC)64kbps

約0.48MB

約18時間

MP3 128kbps

約0.96MB

約9時間

MP3 192kbps

約1.44MB

約6時間

WAV 16bit・16kHz・モノラル

約1.9MB

約4.4時間

WAV 16bit・44.1kHz・ステレオ(CD音質)

約10.6MB

約50分弱

CD音質のWAVだと1時間の会議でも512MBを超えます。長い会議は、MP3やM4Aに変換してから上げるのが現実的です。

ただし、サイズ内に収まっても処理が最後まで終わるとは限りません。公式ヘルプは次のように書いています。

Longer recordings may be processed in smaller sections when Data Analysis is available. Processing is best-effort, and very long recordings may time out.

データ分析(Data Analysis)の機能が使える環境では、長い録音を小分けにして処理することがあります。それでも数時間の録音はタイムアウトの可能性があるため、2〜3時間を超える会議は、前半・後半などに分けて上げるほうが確実です。

Zoomなどの録画ファイルはそのまま上げられるか

会議ツールの録画(映像付きのMP4)は、動画と判定されるとアップロードできません。Zoomなら音声のみのファイル(M4A)も保存できる設定があるので、そちらを使うか、録画から音声だけを書き出してから上げてください。書き出しの設定名はツールやバージョンで違うため、各ツールのヘルプで確認するのが確実です。

対象プラン:Freeは使えない、Goは公式に名指しの記載なし

有料プランなら使えますが、公式ヘルプが名指ししているのはEnterpriseだけです。公式ヘルプの原文は次のとおりです。

Audio uploads are available with paid ChatGPT subscriptions and workspaces, including Enterprise. Audio uploads are not available on the Free plan at this time.

プラン

音声アップロード

補足

Free

使えない

公式ヘルプに「現時点では使えない」と明記

Go

対象と読めるが未確認

有料プランだが、公式に名指しの記載はない

Plus

使える

—

Pro(Pro 100 / Pro 200 / Pro 500)

使える

公式の月額はそれぞれ100ドル・200ドル・500ドル

Business

使える

ワークスペースの設定で使えないことがある

Enterprise / Edu

使える

同上。管理者の設定を確認

すでにGoを契約している人は、添付メニューから音声ファイルを選んで上げられるかを一度試すのが確実です。音声アップロードのためにGoを契約するなら、公式ヘルプの対象プランの記載を確かめてからにしましょう。

料金について、OpenAIは音声アップロードの追加料金を公式に示していません。現時点では、プラン料金の範囲内で使える機能と見られます。国内の報道では、2026年1月30日以降の日本からの新規登録は円建て・税込で、Goが月1,400円、Plusが月3,000円とされています(目安。公式の円価格は地域ごとの表示で、今回は確認できていません)。最新のプラン料金はChatGPTの料金プラン解説を参照してください。

なお、公式ヘルプには「ワークスペースの設定・地域・クライアントのバージョン・選んだモデルによって使えないことがある」とも書かれています。日本では、ギズモード・ジャパンがiPhone版とMac版のアプリで日本語の文字起こしを試しており、国内でも使えることが確認されています。10月7日からChatタブの既定モデルが変わった点はGPT-6 Sol・Lunaの解説にまとめています。

使い方:添付して、してほしいことを書く

操作は通常のファイル添付と同じです。

  1. チャット欄左の「+」から「写真やファイルを追加」を選ぶ
  2. 対応形式の音声ファイルを選ぶ
  3. 「文字起こしして」「要約して」など、してほしいことを書いて送信する
  4. 結果を見て、追加の質問や修正を頼む

指示が短いと、要約の粒度や形式がぶれます。用途に合わせて、出してほしい形をはっきり書くのがコツです。

そのまま使える指示の例

会議の議事メモにする

この会議の録音から、次の4つを表にまとめてください。
・決定事項
・未決事項
・担当者と期限つきのタスク
・次回までに確認すること
発言の中で数字や日付が出てきた箇所は、聞き取れた表現のまま残してください。

専門用語や固有名詞を先に渡す

これから上げる録音には、次の用語が出てきます。
社名:〇〇株式会社、△△物流
製品名:□□クラウド
人名:田中、佐藤、鈴木
この用語を前提に、全文を文字起こししてください。
聞き取れなかった箇所は[不明]と書いてください。

インタビューから要点を抜き出す

このインタビューの録音から、相手が困っていること、
いま使っている方法、要望を、それぞれ箇条書きで抜き出してください。
それぞれ、根拠になった発言をそのまま引用してください。

「話者ごとに分けて」と頼むこともできますが、公式は話者の識別が当てにならないことがあると書いています。名前つきの議事録にするなら、出てきた結果を録音と照らして直す前提で使ってください。

会議の議事録づくりをどこまで自動化できるかは、議事録作成を自動化する方法で詳しく扱っています。

精度の注意点:日本語は実用レベルの報告があるが、公式は確認を求めている

OpenAI Developersの音声ファイル文字起こしガイドのタイトル画像

出典: OpenAI Developers「File transcription」

文字起こしの精度について、公式は数値を出していません。そのかわり、誤りが出ること、言語によって精度が変わることをはっきり書いています。

Transcripts may contain errors, and speaker identification may be unreliable. Review important details against the original recording.

Audio understanding and transcription performance may vary across languages.

一方、ギズモード・ジャパンの検証では、日本語の朗読(バタイユ『呪われた部分』の一節)を文字起こしして、誤りは「有用性」が「有効性」になった1か所だけでした。ひとりが静かな環境で読み上げた音声なら、かなり正確に起こせると見てよさそうです。

ただし、実際の会議はこの条件と違います。精度が落ちやすいのは次のような録音です。

  • 複数人が同時に話す、相づちがかぶる
  • 会議室のマイクから遠い人がいる、空調や雑音が大きい
  • 社名・製品名・業界用語が多い
  • 日本語と英語が混ざる

要約は文字起こしをもとに作られるため、聞き違いがそのまま要約に入ることもあります。金額・日付・数量・人名・決定事項など、間違えると困る部分は、必ず元の録音で確かめてください。

精度を上げるために、利用者側でできることもあります。

  • 録音時にマイクを話者の近くに置く
  • 専門用語・固有名詞のリストを指示の中で先に渡す
  • 長い録音は区切って上げる
  • 「聞き取れない箇所は[不明]と書く」と指示し、推測で埋めさせない

このツールを自社のシステムや業務にどう組み込むか、ご提案します

初回相談は無料・30分(オンライン)。要件が決まっていなくても大丈夫です。改修30万円〜・PoC300万円〜(税別)

開発について相談する

アップロードできないときの確認点

上がらない原因の多くは、形式・サイズ・回数上限のどれかです。公式ヘルプのトラブルシューティングをもとに、確認する順番をまとめました。

確認すること

内容

プランとアカウント

Freeでは使えない。有料プランのアカウントでログインしているか

形式

対応形式か。拡張子だけ変えたファイルではないか

動画判定

MP4・WebMが映像付きと判定されていないか。音声だけ書き出す

サイズ

512MBを超えていないか。WAVはMP3・M4Aに変換する

アップロード回数

3時間あたり最大80ファイル(ファイル全体の上限)。残り回数は画面に出ない

保存容量

1ユーザー25GB、1組織100GB。「設定」の「ストレージ」で使用量を確認できる

アプリのバージョン

アプリを最新にする。ワークスペースなら管理者の設定も確認

障害

status.openai.com で障害が出ていないか

3時間あたり80ファイルという上限は音声専用ではなく、文書や画像も含めた上限です。混雑時にはOpenAIが引き下げることがあり、失敗したアップロードも回数に数えられることがあると公式に書かれています。英語圏のメディア(mixed-news.com)も、残り回数が見えない点を問題として取り上げています。何度も失敗が続くときは、続けて上げ直すより、時間をおいて試すほうが無難です。

会議録音を上げる前に確認したい情報管理

会議やインタビューの録音には、他人の発言や取引先の情報が入ります。上げる前に、次の4点を確認してください。

1. 録音とアップロードの同意

ChatGPT Recordの公式ヘルプは「他人を録音するときは現地の法律を確認し、同意を取ること。責任は利用者にある」と明記しています。音声アップロードのヘルプには同じ記載はありませんが、他人の発言を外部サービスに上げる点は変わりません。参加者には、録音することとAIで文字起こしすることを伝えておくのが安全です。

2. 会社の規程と取引先との約束

会社の会議を個人契約のPlusやProに上げてよいかは、社内規程によります。取引先との打ち合わせなら、秘密保持契約の範囲にも注意が必要です。業務で使うなら、BusinessやEnterpriseのワークスペースを使うほうが管理しやすくなります。

3. 学習に使われるかどうか

OpenAIは、APIやChatGPT Enterpriseなど法人向けサービスに送った内容をモデル改善に使わないとしています。個人向けプラン(Go・Plus・Pro)では、アップロードした文書や画像を学習に使うかどうかはデータ設定によると説明していますが、音声ファイルについての明記は今のところありません。気になる場合は、設定の「データコントロール」で「すべての人のためにモデルを改善する」をオフにしておきましょう。

参考までに、ChatGPT Recordでは音声データは文字起こし後に自動で削除され、学習には使われないと明記されています。音声アップロードに同じ扱いが当てはまるかは、公式に書かれていません。

4. 削除は「会話」と「ファイル」で別の操作

会話を消しても、Library(9月29日以降、対象プランではChatGPT Spaceに置き換え)に保存されたファイルは消えません。ファイルを消すには、LibraryやSpaceでファイルを選んで削除します。「最近削除した項目」に移ったファイルは、完全に削除するまで復元できる状態で残ります。会話に取り込まれた内容も会話の中に残るため、両方を消す必要があります。

生成AIを業務で使うときの情報漏えい対策は、生成AIのセキュリティ対策で整理しています。

ChatGPT Record・Meetings・Voice・APIとの使い分け

OpenAI Developersの音声・ボイス機能ガイドのタイトル画像

出典: OpenAI Developers「Audio and voice」

ChatGPTで音声を文字にする方法は、今回の機能を含めて4つあります。録音済みのファイルなら音声アップロード、Macでその場の会議を録るならRecord、と目的で選ぶのが基本です。

項目

音声ファイルのアップロード

ChatGPT Record

Meetingsプラグイン

Voice・音声入力

用途

録音済みファイルをあとから文字起こし・要約

その場で録音して文字起こし・要約

会議中の発言からメモを取る

話しかけて会話・指示

対象プラン

有料プランとワークスペース(Free不可)

Plus・Pro・Business・Enterprise・Edu

Pro・Business(ベータ)。Enterpriseは近日

Freeを含む全プラン

環境

Webと対応モバイルアプリ

macOSデスクトップアプリのみ

macOSデスクトップアプリ

Web・iOS・Android・デスクトップ

長さの上限

512MB(時間の上限なし。長いとタイムアウトの可能性)

1回最大4時間

公式記載なし

—

話者の区別

当てにならないことがある

複数の話者を区別できる(名前はあとから変更可)

公式記載なし

—

音声データの扱い

公式に明記なし。LibraryやSpaceに残る場合は別途削除

文字起こし後に自動削除

メモ完成後に削除。再生不可

—

WindowsのPCやスマホで録った録音を処理したい人は、音声アップロード一択です。Macで会議をその場で記録し、話者も分けたいならRecordのほうが向いています。ChatGPTとの音声会話についてはGPT-Liveの解説をどうぞ。

OpenAI APIの文字起こしとの違い

大量の録音を自動で処理したい場合は、ChatGPTではなくOpenAIのAPIを使う選択肢があります。

項目

ChatGPTの音声アップロード

OpenAI API(gpt-transcribe)

料金

プラン料金の範囲内(定額)

従量課金。gpt-transcribeは1分あたり0.0045ドル

1ファイルの上限

512MB

25MB

専門用語の指定

指示文で伝える

prompt・keywords・languages の指定で精度を上げられる

話者ラベル・タイムスタンプ・字幕形式

公式記載なし

専用モデルで対応

向いている使い方

1件ずつ手作業で処理する

大量処理、社内システムへの組み込み

API料金はOpenAI公式の料金ページ(2026年10月10日時点)によるもので、gpt-4o-mini-transcribeは1分0.003ドル、gpt-4o-transcribeは1分0.006ドルです。1時間の録音をgpt-transcribeで処理すると約0.27ドルになります。APIの音声モデルについてはgpt-realtime-2の解説も参考になります。

録音を毎日自動で文字起こしし、要約を社内のチャットやCRMに送るような仕組みは、ChatGPTの画面だけでは作れません。こうした処理を自社の業務システムに組み込む方法と費用の目安は、既存システムにAIを組み込む方法で解説しています。

Geminiや専用の文字起こしサービスとの違い

GoogleのGeminiアプリも、2025年9月に音声ファイルのアップロードに対応しています。当時の発表では、無料版は合計10分まで、有料のGoogle AI Pro・Ultraは3時間までとされていました。現在の上限はGeminiの公式ヘルプで確認してください。Gemini全体の特徴はGeminiとは?にまとめています。

Notta、Rimo Voice、PLAUDといった専用の文字起こしサービスは、タイムスタンプ、話者の分離、単語の辞書登録、チームでの共有といった機能が充実しています。議事録を正確に残すことが目的なら、こうしたサービスのほうが手間は少なく済みます。一方、録音の中身について質問したり、要約からメール下書きまで作ったりする用途は、ChatGPTの得意分野です。

ChatGPTの音声文字起こしをおすすめする人・おすすめしない人

おすすめする人

  • すでにPlus・Pro・Businessなどの有料プランを使っていて、追加費用をかけずに録音を処理したい人
  • 会議・インタビュー・講義の録音から、要約・タスク・メール下書きまで一度に作りたい人
  • WindowsやスマホでRecordが使えず、録音済みのファイルを処理したい人
  • 「あの録音で何と言っていたか」を、聞き返さずに確かめたい人

おすすめしない人

  • Freeプランのまま使いたい人(現時点では使えない)
  • 発言者ごとの正確な議事録や、タイムスタンプ付きの記録が必要な人
  • 字幕ファイル(SRTなど)を作りたい人
  • 3時間を超える録音を、分けずに1回で確実に処理したい人
  • 毎日大量の録音を自動で処理したい人(APIや専用サービス向き)
  • 社内規程で、会議の録音を外部のAIサービスに上げることが認められていない人

よくある質問

Q. WindowsのChatGPTデスクトップアプリでも使えますか?

公式ヘルプが挙げているのは「Webと対応モバイルアプリ」で、Windowsのデスクトップアプリについての明記はありません。Mac版アプリで使えたという国内の検証はあります。Windowsで使えない場合は、ブラウザ版(chatgpt.com)から上げるのが確実です。

Q. 処理にはどのくらい時間がかかりますか?

公式は処理時間を示していません。「5分のファイルなら1分未満」とする海外の報道もありますが、OpenAIの裏付けはありません。録音の長さや混雑状況で変わるため、長い録音は時間に余裕をもって処理してください。

Q. 英語の録音を、日本語で要約してもらえますか?

指示文で「日本語で要約して」と書けば、日本語で要約が返ってきます。ただし公式は言語によって精度が変わると書いており、英語の聞き取りの誤りがそのまま訳に入ることもあります。数字や固有名詞は、英語の原文の文字起こしもあわせて出させて確かめると安心です。

Q. Freeプランで録音を文字にする方法はありますか?

録音済みのファイルを上げる方法は、現時点ではFreeにありません。Freeでも使えるのは、その場で話しかけるVoiceや音声入力です。録音ファイルを文字にしたいなら、有料プランにするか、APIや専用の文字起こしサービスを使うことになります。

Q. 上げた音声ファイルは、いつまで残りますか?

保存期間は、保存場所とワークスペースの保持ポリシーで決まります。Enterprise・Edu・Healthcareのワークスペースでは、ファイルはワークスペースの保持ポリシーに従います。個人プランで早く消したいときは、LibraryやSpaceでファイルを削除し、「最近削除した項目」からも完全に削除してください。会話の削除とは別の操作です。

まとめ

  • ChatGPTは2026年10月6日から、音声ファイルを添付して文字起こし・要約・質問ができるようになった
  • 有料プランとワークスペースが対象で、Freeは使えない。Goは公式に名指しの記載がない
  • 上限は1ファイル512MB。MP3(128kbps)なら約9時間分だが、CD音質のWAVは1時間に届かない。長い録音はタイムアウトの可能性もある
  • 映像付きのMP4・WebMは不可。音声だけのファイルにして上げる
  • 日本語は高精度だった検証例があるものの、公式は誤りや話者識別の不正確さを認めている。数字・日付・人名は録音で確かめる
  • 会議録音を上げる前に、参加者の同意・社内規程・学習設定・ファイル削除の手順を確認する
  • Macでその場の会議を録るならRecord、大量処理や社内システムとの連携ならAPI、正確な議事録なら専用サービスと使い分ける

対象プランや上限は今後変わる可能性があります。使う前に、OpenAIの公式ヘルプ「Uploading files and audio to ChatGPT」で最新の条件を確認してください。

このツールを自社のシステムや業務にどう組み込むか、ご提案します

開発について相談する

この記事の著者

AI革命

AI革命

編集部

AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。

AI・システム開発は、小さな改修から相談できます

小規模な既存改修 30万円〜・PoC 300万円〜(税別)。相談内容を送っていただくと、2営業日以内に担当者からご返信します