Mistral OCR 4とは?最新4.1の変更点・170言語対応・料金$4の実情・Google/Azure OCR比較を解説

この記事のポイント
Mistral OCR 4と最新の4.1を公式情報で整理。位置情報・ブロック分類・信頼度スコアの仕組み、旧版との違い、$4/1,000ページへ上がった料金推移、表・手書き・日本語の精度、Google/Azure/AWS OCRとの比較まで解説します。
Mistral OCR 4(ミストラル OCR 4)は、フランスのAI企業 Mistral AI が2026年6月23日に公開した文書解析(ドキュメント・インテリジェンス)モデルで、文字を読み取るだけでなく、各ブロックの位置(バウンディングボックス)・種別の分類・信頼度スコアを構造化データとして返すのが最大の特徴です。現時点の最新版は2026年7月16日に公開された OCR 4.1(Public Preview)で、mistral-ocr-latest や mistral-ocr-4 といった呼び出し名の参照先も4.1に切り替わっています。
本記事では、Mistral OCR 4/4.1の中身、旧版(初代・OCR 3)との違い、$4/1,000ページに上がった料金と価格推移、表・手書き・日本語の精度の実情、Google/Azure/AWSのOCRとの比較、セルフホストによるデータ主権の考え方までを、2026年8月時点の公式情報と実務者の評価をもとに整理します。「4と4.1で何が違うのか知りたい」「他社OCRとどちらが安いのか判断したい」「機密文書を外に出さずにOCRしたい」という方に向けた内容です。
判断の軸は次の3つです。
- テキストだけ大量に抽出したい → Google/Azure/AWSのテキスト抽出API(各$1.50/1,000ページ前後)の方が安い
- 位置情報・ブロック分類・信頼度スコア・170言語・セルフホストを一律のページ課金で欲しい → Mistral OCR 4/4.1($4/1,000ページ、バッチで$2)
- 1ページあたりの精度が生命線の文書 → OCRの出力を鵜呑みにせず、信頼度スコアと人手レビューを前提に設計する
Mistral OCR 4とは何か(開発元・基本情報)

出典: Mistral AI 公式サイト
Mistral OCR 4は、PDFや画像化された文書からテキスト・表・数式・レイアウト構造をまとめて抽出する文書解析AIです。Mistral AIはこのモデルを「単なる文字起こし(text)ではなくセグメンテーション(segmentation)」と表現しており、紙やスキャン文書を、RAG(検索拡張生成)やAIエージェント、社内検索にそのまま組み込める構造化データへ変換することを目的にしています。
項目 | 内容 |
|---|---|
開発元 | Mistral AI(フランス) |
OCR 4 リリース | 2026年6月23日 |
OCR 4.1 リリース | 2026年7月16日(Public Preview) |
APIモデル名 |
|
エンドポイント |
|
提供形態 | Mistral Studio(API)/Mistral Vibe(旧Le Chat)/Amazon SageMaker/Microsoft Foundry(Azure)/セルフホスト(単一コンテナ)/Snowflake(提供予定) |
対応言語 | 170言語・10言語グループ(日本語を含む) |
対応フォーマット | PDF、DOCX、PPTX、PNG、JPEG/JPG、AVIF ほか |
出力 | Markdown+構造化JSON(ブロック座標・種別・信頼度・表・ハイパーリンク等) |
従来のOCRが「文字列だけ」を返していたのに対し、OCR 4は「どこに」「何が」「どれくらいの確からしさで」書かれているかまで一括で返します。これにより、抽出結果をチェックする際に誤認識が起きやすい箇所をピンポイントで特定したり、AIの回答に対して引用元の位置をエビデンスとして提示したりできます。
なお開発元のMistral AIは、LLMのMistral Medium 3.5やワークフロー基盤のMistral Studio Workflowsなど、文書処理を含む企業向けスタックを揃えつつあります。OCR単体ではなく「抽出→後処理→業務システム連携」までを同じベンダーで組める点が、同社の狙いです。
OCR 4.1(2026年7月16日公開)で何が変わったか
現時点の最新版は OCR 4.1 です。OCR 4の大枠の設計はそのままに、バウンディングボックスの正確さと信頼度スコアの粒度を実務寄りに詰めたマイナーアップデートという位置づけです。日本語の解説記事はまだOCR 4止まりのものが多いため、ここは押さえておく価値があります。
観点 | OCR 4(4.0) | OCR 4.1 |
|---|---|---|
公開日 | 2026年6月23日 | 2026年7月16日 |
状態 | Premier / Active | Premier / Public Preview |
段落単位バウンディングボックス | 対応(書き込みの多いページでズレが出る場合あり) | 各要素にぴたりと合う精度に改善(ドリフト・入れ子の解消) |
密な技術図面 | ブロックの取りこぼしが起きうる | 各コールアウトを独立領域として保持(統合しない) |
段組みページ | 1カラムに潰れることがある | 各カラムを独立領域として返す |
信頼度スコアの粒度 |
|
|
バッチ処理 | 対応 | 対応(Batching) |
料金 | $4 / 1,000ページ | 同額($4 / 1,000ページ) |
実務上のインパクトが大きいのは confidence_scores_granularity に block が加わった点です。従来はページ全体か単語単位しか選べず、「ページ単位では粗すぎるが、単語単位では細かすぎて扱いにくい」という中間が空いていました。ブロック単位のスコアが出ると、たとえば請求書なら「明細表のこのブロックだけ確度が低いので目視確認に回す」といったレビュー対象の絞り込みが現実的な粒度でできます。
一方で注意点もあります。OCR 4.1は現時点で Public Preview であり、本番SLAを厳密に求める用途では位置づけを確認したうえで採用するのが安全です。また mistral-ocr-latest および mistral-ocr-4 の参照先が4.1に切り替わっているため、コードを変更していなくても呼び出されるモデルが4.1になっている可能性があります。バージョンを固定したい場合は mistral-ocr-4-0 のように明示指定してください。
従来のOCRとの違い:「文字を読む」から「文書を構造化する」へ
Mistral OCR 4/4.1が従来型OCRと一線を画すのは、出力に位置情報・分類・信頼度という3つのメタ情報が付与される点です。ここがOCR 3以前からの最大の進化でもあります。
1. バウンディングボックス(位置座標)
抽出したブロックがページ上のどこに配置されていたかを座標で返します。抽出テキストと元PDFを重ね合わせて表示したり、「この金額は請求書のこの表のこのセルから来た」と紐づけたりできます。RAGで回答の根拠(引用元)を提示する用途で特に有効で、4.1ではこの座標精度が改善されました。
2. ブロック種別の分類(typed-block classification)
各ブロックが見出し・本文・表・数式・署名などのどれに当たるかを自動分類します。契約書から署名欄だけを抜き出す、論文から数式だけを集める、社内規程から見出し階層を再構成する、といった後工程の自動化がしやすくなります。API側では include_blocks を有効にすると、段落単位の座標と構造ブロックのラベルが読み順で返ります(このパラメータはOCR 4以降のみ)。
3. 信頼度スコア(confidence score)
読み取りの確からしさを数値で返します。粒度は page / block(4.1で追加) / word の3種類。スコアが低い箇所だけ人が見れば済むため、全件目視に比べて確認コストを大きく減らせます。「誰がどのブロックを確認したか」という監査証跡を残す設計にも向きます。
一般的なテキスト抽出型のOCRでは、これらの情報は得られないか、レイアウト解析モデルを別途組み合わせる必要がありました。OCR 4系はこれを一律のページ課金で一括提供します。
押さえておきたい主要パラメータ
パラメータ | 役割 | 備考 |
|---|---|---|
| 段落単位の座標+構造ブロックラベルを読み順で返す | OCR 4以降のみ |
| 信頼度スコアの粒度指定( |
|
| 表の出力形式(インラインMarkdown/ | 複雑な表は |
| ヘッダー・フッターを本文と分離抽出 | OCR 2512(OCR 3)以降 |
| 対象ページ指定( | OCR 4で範囲指定に拡張 |
| 抽出画像をbase64で返す | 図版を保持したいとき |
こうした出力をエージェントやワークフローから呼び出す設計にする場合は、ツール接続の標準仕様であるMCP(Model Context Protocol)の仕組みも合わせて理解しておくと、OCR結果を業務システムへ渡す部分の設計がしやすくなります。
Mistral OCRの版ごとの違いと「もう使えない版」
Mistral OCRは1年半で4世代出ており、ネット上には旧版の情報が大量に残っています。リタイア済みの版が混在している点も含めて整理します。
版 | API識別子 | リリース | 現在の状態 | 主な特徴 |
|---|---|---|---|---|
初代 Mistral OCR |
| 2025年3月6日 | リタイア済(2025年12月31日終了) | Markdown出力、表・数式・複雑レイアウト、画像とテキストの順序保持 |
Mistral OCR 2 |
| 2025年5月22日 | リタイア済(2026年5月31日終了) | 中間バージョン |
Mistral OCR 3 |
| 2025年12月17日 | Active(既存連携向けに維持) | 手書き・フォーム・複雑な表・スキャン文書を強化、HTMLベースの表再構築 |
Mistral OCR 4 |
| 2026年6月23日 | Active | 座標+ブロック分類+信頼度スコア、170言語、 |
Mistral OCR 4.1 |
| 2026年7月16日 | Public Preview(最新) | 座標精度の改善、 |
流れとしては、手書き・複雑な表への対応がOCR 3で強化され、位置情報と構造化がOCR 4で加わり、その精度が4.1で詰められたという3段階です。
導入時に見落とされがちな落とし穴が2つあります。ひとつは、初代(2503)とOCR 2(2505)はすでにリタイア済みで、これらのモデル名を指定したコードは動かないこと。もうひとつは、Google Vertex AIのパートナーモデル一覧には2026年8月時点で mistral-ocr-2505 が掲載されたままである点です。GCP経由で使う想定なら、最新版が利用できるかを事前に確認したほうが確実です(ドキュメントの更新遅れの可能性もあります)。
料金:$4/1,000ページと、値上がりの推移
Mistral OCR 4/4.1はページ単位の従量課金で、2026年8月時点の標準API料金は $4/1,000ページ(ユーロ建て€3.5/1,000ページ)です。1ページあたり日本円でおよそ0.6円前後という水準ですが、旧版から段階的に上がっている点は必ず押さえておくべきです。
プラン | 料金 | 内容 |
|---|---|---|
OCR 4 / 4.1 標準API | $4 / 1,000ページ | テキスト+座標・ブロック分類・信頼度の構造化出力 |
Batch API | $2 / 1,000ページ(50%割引) | 即時性が不要な大量処理向け |
アノテーション付き(Document AI) | $5 / 1,000ページ | 指定スキーマでの項目抽出などを含む |
Mistral Vibe Free(旧Le Chat) | $0 | ファイルをアップロードして手軽に試す用途 |
Vibe Pro | $14.99 / 月 | 個人利用向け |
Vibe Team | $24.99 / ユーザー / 月 | チーム利用向け |
価格推移(ここが最も誤解されている)
版 | 標準API | バッチ |
|---|---|---|
初代(2025年3月) | $1 / 1,000ページ | 実質 $0.5 相当 |
OCR 3(2025年12月) | $2 / 1,000ページ | $1 / 1,000ページ |
OCR 4 / 4.1(2026年6月〜) | $4 / 1,000ページ | $2 / 1,000ページ |
日本語の解説記事の多くが「1,000ページあたり1ドル」と書いていますが、これは初代当時の価格です。現行は4倍の$4であり、月10万ページ処理する想定なら月$400(バッチ利用で$200)と、試算の前提が大きく変わります。海外の開発者コミュニティでも「リリースごとに実質倍増している」という指摘が最も多い批判点になっています。
コストを抑える現実的な手段は2つです。第一に、即時性が不要な処理はBatch APIに寄せて50%オフにすること。夜間バッチで前日分の請求書をまとめて処理する、といった設計が典型です。第二に、全ページを最高精度で処理しないこと。テキストだけで足りるページは安価なテキスト抽出APIに回し、構造情報が必要な帳票だけMistralに投げる、というハイブリッド運用が効きます。
生成AI全体のコスト感を並べて検討したい場合は、主要生成AIの料金比較も参考になります。
表・手書き・日本語の認識精度はどれくらいか

表や複雑なレイアウトの構造保持は高水準である一方、手書きと日本語の文字認識は「常に最強」とは言えないというのが2026年8月時点の実情です。
公称ベンチマーク(すべてベンダー自己評価)
Mistralが公表しているOCR 4のスコアは次のとおりです。いずれもMistral自身による評価である点に注意してください。
- OlmOCRBench:85.20(総合トップを主張)
- OmniDocBench:93.07
- 600件以上の実文書・12言語以上での人手ブラインド評価で、競合に対し平均72%の勝率
- OCR 3はOCR 2比で総合74%勝率(フォーム・スキャン・複雑な表・手書き)
Mistral自身も、自動ベンチマークには「正解データ側の誤り」「表記の等価性の判定ミス」「列順の前提」といった限界があり、正しく抽出していても減点されるケースがあると明言しています。加えて海外の技術者コミュニティでは「比較チャートのY軸が50〜95%で切り取られており、差が実際より大きく見える」という指摘も出ています。スコアは参考値として扱うのが妥当です。
表・数式・スキャン文書
OCR 3以降、手書き文字・フォーム・複雑な表・スキャン文書への対応が強化されました。表は table_format でHTMLとして構造を再構築でき、数式はLaTeX相当で扱えます。レイアウトや表構造を崩さずに抽出できる点は、国内の検証レポートでも共通して評価されています。実務者からも「PDF→EPUB変換でヘッダー・タイトル・脚注参照を毎回正しくタグ付けできた」「プロンプト調整なしでPDFを投げるだけで済むのが大きい」という声があります。
日本語精度の実測値(旧版時点・第三者検証)
日本語の実用精度を数値で示した公式データは、現時点では公開されていません。 参考として、国内SIerが公開した検証結果を挙げますが、これはOCR 4以前(初代〜OCR 3時点)・自社テスト・母数非公開の値であり、OCR 4/4.1の数字ではない点に注意が必要です。
文書種別 | Mistral OCR(旧版) | Google Cloud Vision | Adobe OCR | Tesseract |
|---|---|---|---|---|
日本語活字 | 87.5% | 89.2% | 85.3% | 81.0% |
手書き | 72.3% | 78.1% | 74.5% | 65.2% |
この検証では、句読点や特殊記号の誤認、手書きでGoogle Cloud Visionに劣る点が弱点として指摘されています。活字の日本語文書は実務水準に達しているものの、手書き文書を扱う企業は導入前に自社データで必ずテストするのが前提です。
手書きについては評価が割れており、「手書きのメールアドレス群はChatGPTでは修正だらけだったが、Mistralは一発で正確だった」という報告がある一方、「手書きはClaudeの方が明確に上」という声もあります。文書の種類・書き手の癖・スキャン品質で結論が変わると考えたほうが実態に近いでしょう。
苦手な文書
実務者からは、合字(ligature)、批判校訂記号、フラクトゥール、上付き・下付きが多用される歴史的・学術的な組版では精度が落ちるとの報告があります。ただしこれは「最高性能クラスのモデルでも同様に苦手」とされる領域で、Mistral固有の弱点というより現行OCR全体の限界に近い部分です。
見落としてはいけないリスク:ハルシネーションと運用設計
LLMベースのOCRに共通する課題として、存在しない文をもっともらしく生成してしまう(ハルシネーション)リスクがあります。これは従来型のパターンマッチ型OCRにはない性質で、Mistral OCRも例外ではありません。
実務者からは、「Mistral OCRとClaudeを比較したところ、Mistralが丸ごと捏造した文をClaudeの校正工程で検出できた」という具体的な報告が上がっています。特に劣化したスキャン画像や、判読困難な箇所で起きやすいとされます。
したがって、精度が業務品質に直結する用途では、次のような運用側の防御を前提に設計してください。
- 信頼度スコア(block粒度)で閾値を切り、低確度ブロックだけ人手確認に回す
- 抽出結果を別モデルで校正する二段構えにする(抽出=Mistral、校正=別のLLM、という役割分担は実際に採用例がある)
- 金額・日付・氏名など、業務上クリティカルな項目は必ずルールベースで妥当性検証する(合計値の突合、日付形式チェックなど)
- 原本の該当箇所を座標で参照できるようにしておく(バウンディングボックスの実務的な最大の価値はここ)
また、医療・法務などの文書では「VLM(視覚言語モデル)が内容を暗黙にフィルタリングしない保証がない」という懸念も指摘されています。センシティブな文書を扱う場合は、抜けや改変が起きていないかを検証する工程を必ず組み込んでください。AIを業務プロセスに組み込む際の全体的な注意点は、生成AIのセキュリティリスクと対策にまとめています。
Google/Azure/AWSのOCRとの比較

「Mistral OCRは他社より高いのか」という疑問には、何を抽出したいかで答えが逆転するというのが正確な回答です。単純なテキスト抽出だけならクラウド大手の方が安く、構造化まで含めるとMistralが安くなります。ここを分けずに書いている比較記事が多いため、テキスト抽出だけの単価と、構造化まで含めた単価の2軸に分けて見ていきます。
軸1:テキスト抽出だけの単価(1,000ページあたり)
サービス | テキスト抽出の料金 | 無料枠 |
|---|---|---|
Mistral OCR 4 / 4.1 | $4(バッチ $2) | Vibe(旧Le Chat)で試用可 |
Google Document AI(Enterprise Document OCR) | $1.50(500万ページ超は $0.60) | 新規$300クレジット |
Azure AI Document Intelligence(Read) | $1.50 | 月500ページ恒常無料(F0) |
AWS Textract(DetectDocumentText) | $1.50 | 3か月間・月1,000ページ |
セルフホストOSS(Tesseract等) | 実質GPU/電力コストのみ | 無料 |
この軸だけを見ると、Mistralはクラウド大手の約2.6倍です。テキストが取れれば十分な用途で、あえてMistralを選ぶ経済的理由はありません。
軸2:位置情報・レイアウト構造まで含めた単価(1,000ページあたり)
サービス | 構造化(レイアウト/帳票解析)の料金 | 位置情報 | セルフホスト |
|---|---|---|---|
Mistral OCR 4 / 4.1 | $4(標準APIに含む/アノテーション付きで$5) | ◯(ブロック座標+分類+信頼度) | ◯(単一コンテナ) |
Google Document AI | Layoutアドオン $6、Form Parser/Custom Extractor $30(100万ページ超 $20) | ◯ | ×(GCP前提) |
Azure AI Document Intelligence | Layout $10、Prebuilt $10、Custom抽出 $30〜$50 | ◯ | △(一部コンテナ提供) |
AWS Textract | Forms/Tables 各 $15、AnalyzeExpense $8〜$10 | ◯ | × |
この軸だと関係が反転し、Mistralが2.5〜7.5倍安い計算になります。Mistralの価値は「位置情報+ブロック分類+ブロック単位の信頼度+170言語+セルフホスト」を、機能ごとの追加課金なしに一律ページ課金でまとめて得られる点にあります。
※各社の料金は変動します。導入試算の前にはGoogle Document AI 料金ページ、Azure AI Document Intelligence 料金ページ、AWS Textract 料金ページで最新値を確認してください。
比較のまとめ
- テキストだけ大量に → Google/Azure/AWS($1.50)。Azureは月500ページの恒常無料枠があり、少量検証にも向く
- 座標・分類・信頼度・多言語を一律料金で → Mistral OCR 4/4.1($4、バッチ$2)
- 機密文書を外部に出せない → Mistralのセルフホスト、またはOSSのセルフホスト
- コスト最優先で自社GPUがある → OSSセルフホスト(実務者報告で1,000ページ$0.05〜0.10という水準の例もある。ただし複雑レイアウトは弱い)
クラウド側のAIサービス全体を検討しているなら、Geminiの機能と料金の整理も判断材料になります。
Mistral OCR 4の使い方(3つの利用方法)
利用方法は大きく3つです。検証から本番までの段取りとして、上から順に試すと無駄がありません。
1. Mistral Vibe(旧Le Chat)で試す
Mistralの公式チャットUIは、2026年5月28日に Le Chat から「Mistral Vibe」へ改称されました(Work/Code/Chatの3モード構成。URLとアカウントは同一)。日本語記事の多くが旧称のままなので注意してください。ファイルをアップロードして抽出結果を確認できるため、API契約前に日本語の読み取り具合を体感したい場合の入口になります。ただし、無料プランでどの版のOCRが動くかは公式に明示されていないため、精度の最終判断はAPIで行うのが確実です。
2. API(システムに組み込む)
/v1/ocr エンドポイントに mistral-ocr-latest(現在4.1)や mistral-ocr-4-1 を指定して呼び出します。出力は pages(Markdown/画像/表/ハイパーリンク/メタデータ)と blocks(領域・座標・信頼度)、confidence_scores、usage_info などの構造化JSONです。RAGパイプラインやAIエージェント、社内検索に「引用可能(citation-ready)」な形で組み込めます。即時性が不要な大量処理はBatch APIで50%割引になります。
抽出後の要約・分類・仕訳といった後処理までを一連のワークフローとして組む場合は、Mistral Studio Workflowsのようなオーケストレーション基盤と組み合わせる設計が想定されています。
3. セルフホスト(自社インフラで動かす)
単一コンテナで完結するセルフホストに対応しています。文書データを自社インフラの外に出さずにOCR処理でき、エンタープライズ要件の強い組織向けの選択肢です。提供形態はMistral Studio(API)、Amazon SageMaker、Microsoft Foundry(Azure)、オンプレミスと幅広く、Snowflake Parse Documentとの連携は2026年8月時点で「Coming soon」のままです。
セルフホストとデータ主権:国内企業の判断ポイント

出典: Mistral AI 公式サイト
Mistral OCRがエンタープライズ用途で注目される理由のひとつが、セルフホストによるデータ主権(data sovereignty)の確保です。
契約書・人事書類・診療記録・財務書類といった機密文書をクラウドOCRに送ると、データが外部サーバーを経由します。個人情報保護法や社内規程、業界ガイドラインの観点でこれがハードルになるケースは少なくありません。Mistral OCRは単一コンテナでセルフホストできるため、文書を外部に送信せず自社環境内で処理を完結できるのが強みです。海外の議論でも「欧州企業がデータ主権を理由にMistralを選ぶ」という声が最も多く挙がっています。
同社はセルフホスト前提の小型モデル(安全性フィルタ用のShieldstralなど)も揃えており、抽出から後処理まで自社環境内で組み立てられる構成を取りやすい点も特徴です。AIエージェントに文書処理を任せる設計を検討している場合は、AIエージェントのセキュリティ対策で権限設計の考え方を確認しておくと安全です。
なお、モデルガバナンス情報を公開している legal.mistral.ai のページは、2026年8月時点でOCR 4系の記載が未反映(2503/2505止まり)です。ガバナンス文書の提出が必要な導入プロセスでは、Mistral側に最新版のドキュメントを確認するのが確実です。
用途別のおすすめと選び方
導入判断は「何を抽出したいか」「どこにデータを置けるか」「精度要求はどれくらいか」の3点で決まります。
ケース | 推奨 | 理由 |
|---|---|---|
大量のPDFからテキストだけ欲しい | Google/Azure/AWS のテキスト抽出API | $1.50/1,000ページで約2.6倍安い |
請求書・契約書から項目を位置つきで抽出したい | Mistral OCR 4.1 | 座標+分類+信頼度が標準料金に含まれる |
RAGで回答に引用元ページを表示したい | Mistral OCR 4.1 | 引用可能な構造化出力を一律料金で得られる |
人手レビュー工数を削りたい | Mistral OCR 4.1 | ブロック単位の信頼度で確認対象を絞れる |
多言語(低リソース言語含む)の文書が混在 | Mistral OCR 4.1 | 170言語・10言語グループ対応 |
機密文書を社外に出せない | Mistral セルフホスト or OSS | 単一コンテナで自社内完結 |
月数百ページ程度の少量利用 | Azure(月500ページ恒常無料) | 無料枠で足りる可能性が高い |
コスト最優先・自社GPUあり | OSSセルフホスト | 実務者報告で$0.05〜0.10/1,000ページの例あり |
1ページの精度が生命線(法務・医療) | 高性能LLM+人手検証を併用 | どのOCRも単独では完全ではない |
実際の業務で「紙の証憑をどう処理するか」まで踏み込んで検討したい場合は、税理士・会計事務所のAI活用事例(AI OCR仕訳を含む)が、帳票OCRの現実的な運用イメージの参考になります。
こんな人におすすめ
- 多言語の文書を扱う組織(170言語対応。低リソース言語を含む)
- RAGやAIエージェントに文書を組み込みたい(位置情報付きの引用可能な出力が必要)
- 抽出結果の人手レビューを効率化したい(ブロック単位の信頼度で確認対象を絞れる)
- 機密文書を外部に送りたくない(セルフホストでデータ主権を確保)
- 表・数式・複雑レイアウトを構造を保ったまま抽出したい
- 構造化抽出を機能別課金ではなく一律ページ課金でシンプルに使いたい
- スキャン品質が安定した活字中心の文書を大量に処理する
おすすめしない人
- 単純なテキスト抽出だけで足りる(Google/Azure/AWSが$1.50で約2.6倍安い)
- 日本語の重要文書を人手チェックなしで完全自動処理したい(誤認識とハルシネーションの検証工程が必須)
- 手書き文書がメイン(評価が割れており、自社データでの事前検証なしに選ぶのは危険)
- すでにGCPやAzureに深く統合しており、同一環境内で完結させたい(GCP経由では旧版が掲載されたままの点も要確認)
- 月数百ページ程度の少量利用(Azureの月500ページ恒常無料枠で足りる)
- 本番SLAを厳密に求める用途(4.1はPublic Preview段階)
- 合字・特殊組版など歴史的・学術的な難文書が中心
判断に迷ったら、「テキストだけならクラウド大手、位置・分類・信頼度・多言語・セルフホストが要るならMistral OCR 4.1」という基準で切り分けると整理しやすくなります。ツール選定全体を見直したい場合は、生成AIツールのおすすめ比較も合わせてご覧ください。
よくある質問(FAQ)
Mistral OCR 4と4.1は、どちらを指定すべきですか?
新規に組むなら mistral-ocr-4-1 または mistral-ocr-latest(現時点で4.1を指す)が基本です。料金は同額で、座標精度と信頼度スコアの粒度が改善されています。ただし4.1はPublic Preview段階のため、挙動を固定したい本番システムでは mistral-ocr-4-0 を明示指定してバージョンを固定する運用も選択肢になります。
「Le Chat」で無料で使えると書いてある記事を見ましたが、今も使えますか?
Le Chatは2026年5月28日に Mistral Vibe へ改称されました。URLとアカウントは同一で、無料プランは引き続き提供されています。ただし、Vibeの無料プランでどの版のOCRがどこまで使えるかは公式に明示されていないため、精度検証や本格利用はAPIで行うのが確実です。
1,000ページ1ドルという料金情報を見かけますが本当ですか?
それは2025年3月公開の初代Mistral OCRの価格です。現行のOCR 4/4.1は $4/1,000ページ(Batch APIで$2)で、OCR 3の時点で$2に上がっています。ページ数の多い業務で試算する際は、この差が数倍のコスト差になるため注意してください。
抽出内容が捏造されることはありますか?
LLMベースのOCRに共通する課題として、判読困難な箇所で存在しない文が生成される報告があります。ブロック単位の信頼度スコアで低確度箇所を人手確認する、別モデルで校正する、金額や日付はルールベースで突合するといった検証工程を運用に組み込むことを前提に設計してください。
社内の機密文書を外部に送らずに使えますか?
可能です。Mistral OCRは単一コンテナでのセルフホストに対応しており、文書データを自社インフラ内に保持したまま処理できます。データ主権や個人情報保護の要件がある組織に向いた選択肢です。
Google Cloud経由で使えば最新版が利用できますか?
2026年8月時点のGoogle Cloudのパートナーモデル一覧には mistral-ocr-2505(Mistral本体では2026年5月31日にリタイア済みの版)が掲載されています。GCP経由での利用を前提にする場合は、どの版が提供されているかを事前に確認してください。ドキュメントの更新遅れの可能性もあります。
手書きの帳票に使えますか?
OCR 3以降で手書き対応は強化されていますが、評価は割れています。「手書きのメールアドレスを一発で正確に読めた」という報告がある一方、「手書きは他のモデルの方が上」という声もあります。旧版時点の第三者検証では手書き72.3%(Google Cloud Vision 78.1%)という数値も報告されており、自社の実データでの事前検証が必須です。
まとめ
Mistral OCR 4は、2026年6月23日にMistral AIが公開した文書解析AIで、バウンディングボックス・ブロック種別分類・信頼度スコアを構造化データとして返し、日本語を含む170言語に対応するモデルです。2026年7月16日にはOCR 4.1が公開され、座標精度の改善とブロック単位の信頼度スコアが加わりました。呼び出し名 mistral-ocr-latest の参照先も4.1に切り替わっています。
料金は$4/1,000ページ(Batch APIで$2)。初代の$1、OCR 3の$2から段階的に上がっており、ネット上に残る「$1」の情報は古いものです。単純なテキスト抽出だけならGoogle/Azure/AWSが$1.50で安く、位置・分類・信頼度・多言語・セルフホストまで一括で欲しいならMistral OCR 4.1、という切り分けが実務的な判断軸になります。
一方で、日本語精度の公式データは存在せず、手書きの評価は割れ、ハルシネーションのリスクもあります。信頼度スコアで低確度ブロックを絞り込み、人手または別モデルで検証する運用を前提に設計すれば、コストと精度のバランスを取りやすいモデルです。機密文書を扱う組織にとっては、単一コンテナでセルフホストできる点が他社にない決定的な判断材料になります。
このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します
業務を1つ送るこの記事の著者

AI革命
編集部
AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。
最新記事

LINEヤフー Agent iとは?27領域の領域エージェント・使い方・料金・Agent i Bizの現状【2026年9月】
2026/06/17

Claude Opus 5.5とは|料金・性能・Opus 5/Fable 5.1との違い・使い方【2026年9月】
2026/09/26

ChatGPT Workとは?料金はFree $0・Plus $20・Pro $100〜・Business $25|GPT-6対応とClaude Coworkとの違い【2026年9月】
2026/07/10

OpenAIのミスアライメント報告フレームワークとは|GPT-5.6 Solのミス隠蔽指示・APIキー無断利用など6件の事例・企業がAIエージェント運用で備えるべきこと【2026年9月速報】
2026/09/26

Anthropic×日立の戦略的パートナーシップとは?29万人Claude導入・10万人AI人材育成・Lumada 3.0強化を解説【2026年9月最新】
2026/05/22

Google Home MCPとは?Claude・ChatGPT・OpenClawからスマートホーム操作|設定手順・料金月20ドル・日本での利用可否とセキュリティ【2026年9月】
2026/09/25

