AIツール2026年10月更新

OpenAIの社内AIが数学の未解決問題を解決と主張、原稿722本を公開|リーマンゼータ関数・ホッジ予想・Lean形式証明・Claudeとの比較と信頼性【2026年10月】

公開日: 2026/10/07
OpenAIの社内AIが数学の未解決問題を解決と主張、原稿722本を公開|リーマンゼータ関数・ホッジ予想・Lean形式証明・Claudeとの比較と信頼性【2026年10月】

この記事のポイント

OpenAIが2026年10月6日、社内AIによる数学原稿722本を公開し、未解決問題100件超の解決を主張。「722件を解決」は誤りです。準リーマン予想・ホッジ予想の中身、Lean形式証明の範囲、Claudeとの比較、信頼性の論点を整理します。

OpenAIが2026年10月6日(米国時間)に公開したのは、未公開の社内AIが書いた数学原稿722本(372の成果群)です。「未解決問題を722件解決した」わけではありません。OpenAIは「100件を超える未解決問題を解いた」と主張していますが、外部の数学者による確認はまだ終わっておらず、主結果がLeanで機械検証されている原稿は報道ベースで162本(約22%)にとどまります。

リーマン予想そのものが解けたわけでも、ミレニアム懸賞問題としてのホッジ予想やナビエ–ストークス問題が解けたわけでもありません。いま言えるのは、大量の「主張」が検証待ちの状態で一度に公開されたということです。

目玉は準リーマン予想(Re s > 7/8 に零点がない)とCMアーベル多様体のホッジ予想です。Claude(Anthropic)の数学成果と比べると、規模ではOpenAIが圧倒する一方、人間の著者・外部専門家・arXivを通した検証の丁寧さではAnthropicのゼータ成果が上回ります。この成果だけで「どちらのAIが優秀か」は決められません。

この記事でわかること

  • 「722」「372」「約4,000」「162」がそれぞれ何を数えた数字なのか
  • 準リーマン予想(リーマンゼータ関数の零点なし領域)とCMアーベル多様体のホッジ予想は、何を主張しているのか
  • Lean形式証明でカバーされる範囲と、カバーされない範囲
  • 数学界(AGMAI・フィールズ賞受賞者ら)の反応と、信頼性をめぐる4つの論点
  • Claude(Anthropic)の数学成果と比べたときの、規模や検証の進め方の違い
  • SNSで「AIが証明した」という投稿を見たときの確かめ方

こんな方に向けた記事です

ニュースの見出しだけでは中身がつかめなかった方、社内やSNSでこの件を正確に説明したい方、研究や業務で使うAIを選ぶときの判断材料がほしい方を想定しています。


何が発表されたのか|「722件を解決」ではなく「722本の原稿」

数式が書かれた黒板と分度器。OpenAIが社内AIによる数学原稿722本を公開したニュースのイメージ

OpenAIは、モデル開発の一環として社内AIに研究レベルの未解決問題を解かせ、その成果をGitHubリポジトリ openai/math(Apache-2.0ライセンス)で公開しました。同じ日に公式ブログ「Sharing AI progress in mathematics」も出ています。

見出しの「722」は原稿(manuscripts)の本数です。問題の件数ではありません。公開資料に出てくる数字を整理すると次のとおりです。

数字

何の数か

出どころ

722

原稿(論文形式のPDF)の本数

GitHub(CONTENTS.md)

372

成果群(関連する原稿をまとめた単位)の数

GitHub(README・CONTENTS.md)

約4,000

評価期間中にモデルへ出した問題の数

GitHub(README)

100件超

OpenAIが「解いた」と主張する未解決問題の数

公式ブログ(各報道が引用)

162

主結果がLeanで形式化された原稿の数(約22%)

報道(XenoSpectrum、ビジネス+IT、Unite.AIなどが一致して報道)

235

成果群のうち、Lean形式化のページがあるもの(約63%)

GitHub(CONTENTS.mdの集計)

約3時間

1つの成果あたりの平均計算量(ChatGPT Proの思考時間に換算)

GitHub(README)

※ 「100件超」と「162本」はOpenAI公式ブログの数字として各報道が引用しているもので、GitHub上の資料では確認できないため、報道ベースの数字として扱っています。

READMEに書かれていること

リポジトリのREADMEでは、OpenAI自身が次の点を明記しています。

  • 既存の数学評価(ベンチマーク)が飽和したため、未解決の研究問題を使った評価に広げた
  • 大半の結果は、未公開の社内モデルを同じ手順で動かして得た
  • 検証の進み具合は結果ごとに違い、すべてにLean形式化があるわけではない
  • 形式化されていない結果には誤りが含まれているかもしれない。見つかれば修正し、過去の版も残す
  • 例外として、リーマンゼータ関数の零点なし領域の研究と、CMアーベル多様体のホッジ予想の証明は、決まった手順の外で得られた。Re(s) > 11/12 版の原稿は読みやすくするために人間が手を入れている

使ったモデルの名前は公表されていません。Gizmodoの報道によると、OpenAIは「この結果を出したモデルを、責任ある形で公開できるよう取り組んでいる」と説明していますが、公開時期は示されていません。

公開されたファイル

フォルダ・ファイル

中身

overview.pdf

成果群ごとの解説

CONTENTS.md

原稿の一覧(成果群ごとに原稿PDF・Leanページへのリンク)

preprints/

原稿のPDF・ソース・引用情報

lean/

Leanライブラリ、形式化の範囲を記した formalization.yaml、Comparatorでの検証手順

reasoning_traces/

10の成果群について、モデルの推論を要約したもの

原稿のフォルダ名を見ると、準リーマン予想の7/8版は2026年9月30日、11/12版の別証明は10月5日、ユニークゲーム予想は9月23日の日付になっています。公開直前の数週間で大量の原稿が作られたことがわかります。


主な成果|リーマンゼータ関数・ホッジ予想ほか

数式が印刷された紙面のクローズアップ。リーマンゼータ関数とホッジ予想に関するOpenAIの成果のイメージ

目玉は準リーマン予想とCMアーベル多様体のホッジ予想の2つです。ほかにも、知られた難問の名前がつく成果が並んでいます。次の表に挙げた成果はすべてOpenAIの主張で、外部の査読や確認はまだ済んでいません。

番号

成果(OpenAIの主張)

分野

Lean形式化

003

準リーマン予想:ζ(s)を含むすべてのディリクレL関数は Re s > 7/8 に零点を持たない(11/12版の別証明、ランダウ–ジーゲル零点の一様な排除も)

数論

あり(主定理など。論文後半の応用は対象外)

032

CMアーベル多様体のホッジ予想:全次元・全余次元で有理ホッジ予想を証明。系として有限体上のアーベル多様体のテイト予想など

代数幾何

なし

002

BSD予想の主要項の公式(Selmer余階数0または1の楕円曲線)

数論

なし

004

有理数体上のヒルベルト第10問題(否定的に解決)

数理論理・数論

なし

017

πの無理数度はちょうど2(Flint–Hills級数の収束も)

数論

あり

087

マーラー予想(対称・非対称、全次元)

凸幾何

あり

102

ユニークゲーム予想(Khot)の証明と、Max-Cutなどの近似困難性

理論計算機科学

あり

109

整数の掛け算を n log n より速く行う方法(Schönhage–Strassen予想の反証)

アルゴリズム

なし

159

等差数列に関するエルデシュの逆数和予想

組合せ論

あり

197

カプランスキーの直接有限性予想の反例(標数2)

環論

あり

287

自由群因子の同型問題(L(F2)≅L(F3))

作用素環

あり

376

外力を加えたナビエ–ストークス流で万能計算ができる

数理流体

あり(一部)

分野の内訳は、理論計算機科学40、組合せ論37、代数・複素幾何36、数論31成果群などと報じられています(kingy.ai ほか)。

一覧を見ると、大きな主張ほどLean形式化がない傾向があります。ホッジ予想(032)、BSD予想の主要項(002)、ヒルベルト第10問題(004)、整数乗算(109)は、どれも分野の常識を書き換えるほどの主張ですが、現時点で機械検証の裏付けはありません。

準リーマン予想とは|リーマン予想との違い

リーマン予想は「ゼータ関数の非自明な零点は、すべて実部が1/2の直線(臨界線)の上にある」という予想です。1859年に提唱され、いまも解かれていません。

準リーマン予想は、これを弱めた主張です。「1より小さいある定数θがあって、実部がθより大きい領域には零点がない」ことを示せれば成り立ちます。今回OpenAIが主張しているのは、θ = 7/8 で成り立つ、つまり Re s > 7/8 に零点がないという結果です。

主張の中身

状態

リーマン予想

非自明な零点はすべて Re s = 1/2 上にある

未解決

準リーマン予想(今回)

Re s > 7/8 には零点がない

OpenAIが証明を主張。主定理はLean形式化あり

これまでの到達点

零点がない領域は Re s = 1 に近づくほど細くなり、一定の幅を保証できていなかった

—

これまで知られていた零点なし領域は、虚部が大きくなるにつれて Re s = 1 の線に限りなく近づいていく形でした。「7/8より右には一つもない」と一定の幅で言い切れるなら、素数の分布の誤差評価が大きく改善されることになり、本当なら解析的整数論では歴史的な結果です。ただし、1/2の臨界線まではまだ距離があり、リーマン予想が解けたわけではありません。

CMアーベル多様体のホッジ予想

ホッジ予想はクレイ数学研究所のミレニアム懸賞問題の1つで、「ある種のコホモロジー類は、必ず代数的な部分多様体から作れる」という主張です。今回OpenAIが主張しているのは、CM(虚数乗法)という特別な対称性を持つアーベル多様体に限った場合の証明です。

対象が限られているとはいえ、全次元・全余次元で示したとすれば、テイト予想(有限体上)やホッジ標準予想などへの波及もあり、大きな主張です。一方で、この成果群にはLean形式化がなく、推論要約も公開されていません。正しいかどうかは、代数幾何の専門家が原稿を読み込むまでわかりません。ミレニアム懸賞問題としてのホッジ予想が解けたわけではない点にも注意が必要です。

ナビエ–ストークスの成果(376)はミレニアム問題とは別物

一部の報道は「ナビエ–ストークス問題が解かれた」と書いていますが、今回の376は外力を工夫した流れの中で計算を実行できることを示す構成です。外力なしの3次元で滑らかな解が続くかを問うミレニアム懸賞問題とは別の問題です。

2026年9月8日にOpenAIが発表した「有限時間爆発」(外力ありの選択肢(C)(D))もまた別の成果で、詳しくはOpenAIがナビエ・ストークス方程式を解決?|何が証明され何が残ったかで解説しています。


Lean形式証明で何が保証されるのか

定理証明支援系Leanの公式バナー。OpenAIは一部の数学成果をLean 4で形式化して公開した

出典: Lean 公式サイト

Leanは、証明を形式言語で書き、その論理が正しいかを機械でチェックできるソフトウェア(定理証明支援系)です。Leanでチェックが通れば、書かれた前提から書かれた結論が正しく導かれていることは、人間が読まなくても保証されます。

ただし、Leanがあるからといって「論文全体が正しい」とまでは言えません。今回の公開では、機械検証を通っているのは一部の原稿の、さらに一部の主張です。

形式化されているのは主結果ベースで約22%

報道によると、主結果がLeanで形式化された原稿は722本中162本(約22%)です。残りの約560本は、Leanの裏付けも人間の査読もまだないことになります。

ここでややこしいのが「235」という数字です。CONTENTS.mdでLeanページへのリンクがある成果群は372のうち235(約63%)ありますが、これは成果群単位の数で、原稿単位の162とは数え方が違います。「6割以上がLean検証済み」と読むのは誤りです。

Leanが保証すること・しないこと

観点

Leanで保証される

Leanでは保証されない

論理

前提から結論までの推論に穴がない

—

主張の文言

—

形式化した定義や主張が、原稿の数学的な主張と一致しているか

対象範囲

形式化された定理

原稿のうち形式化されていない部分(003は「論文後半の応用は範囲外」、376は「一部は範囲外」と公式ドキュメントに明記)

基盤

Leanカーネルが健全であることを前提に成り立つ

カーネルや使用した公理そのものの正しさ

OpenAIのリポジトリには、第三者が手元で検証できるよう、leanprover/comparator を使った手順が同梱されています。たとえば準リーマン予想なら、lake env comparator ComparatorChallenges/QuasiRiemannHypothesis.json を実行すると、あらかじめ定められた問題文に対して証明がチェックできます。自社で書いた問題文だけでなく、比較用の問題定義に照らして確かめられるようにしている点は、評価してよい部分です。


信頼性をめぐる4つの論点

信頼性の問題は「AIが書いたから怪しい」という話ではありません。検証の量と公開のしかたが、主張の大きさに追いついていないことが論点で、大きく4つに分けられます。

論点1:形式化されているのは約2割

722本のうち、主結果がLeanで形式化されているのは約22%です。OpenAI自身がREADMEで「形式化されていない結果には問題があるかもしれない」と認めています。大きな主張ほどLeanがないことを考えると、話題性と検証の度合いが逆になっていると言えます。

論点2:Leanがあっても範囲は限られる

Leanがある成果群でも、形式化されているのは主定理だけで、応用部分が対象外のケースがあります。見出しで紹介される結果と、機械検証された範囲が一致しているとは限りません。

論点3:モデルもプロンプトも非公開で、再現できない

使ったモデルの名前・プロンプト・試行の失敗例は公開されておらず、推論要約も10の成果群(全体の約3%)にとどまります。準リーマン予想とホッジ予想の推論要約は含まれていません。外部の研究者が同じ手順を再現して確かめることはできません。

推論要約が公開された成果群は、007(乗法的関数の2点相関)、017(πの無理数度)、087(マーラー予想)、102(半正定値閾値でのNP困難性)、159(等差数列の準多項式上界)、197(カプランスキー予想・標数2)、221(希薄スピングラスのMézard–Parisi公式)、271(量子ハイゼンベルク強磁性体の自発磁化)、287(自由群因子の同型)、362(3次元相対論的Vlasov–Maxwell系)です。

論点4:自社GitHubで公開し、査読前

公開先はarXivや学術誌ではなく、OpenAIが管理するGitHubです。数学界の独立助言グループAGMAIは、9月29日に公表したガイドラインで次のような開示を求めていましたが、今回の公開は一部にしか応えていないと報じられています(tech-insider、cellcogほか)。

AGMAIガイドラインが求めたこと(報道ベース)

今回のOpenAIの公開

AIラボが管理しない学術リポジトリへの登録

自社のGitHub(コミュニティ運営のリポジトリは「検討中」)

永続的な引用ID

原稿ごとに引用情報はあるが、外部リポジトリのIDではない

モデル名の開示

非公開(「未公開の社内モデル」のみ)

プロンプト・推論要約の開示

推論要約は10成果群のみ

所要時間・推定計算コストの開示

平均「ChatGPT Pro思考約3時間/結果」のみ。総コストは非開示

可能な限りの形式化

主結果ベースで約22%

総コストやトークン数、失敗した試行の数は公開されていません。kingy.ai も「公開情報から総額は算出できない」としています。

未公開の研究データをAIに入力することのリスクや、OpenAIのデータの扱いをめぐる議論はOpenAIは未公開の研究データを使ったのか|研究者が取るべき対策で詳しく扱っています。


数学界の反応|「始まりであって完了ではない」

黒板に数式を書く研究者の後ろ姿。AIによる数学成果を数学界がどう検証するかのイメージ

数学界の受け止めは、成果の可能性を認めつつ、検証と公開のしかたに注文をつけるというものです。

AGMAI(Advisory Group on Mathematics and AI)

AGMAIは、プリンストン高等研究所(IAS)が事務局を務める独立した助言グループで、AI企業から報酬を受け取っていません。メンバーはTimothy Gowers氏、Martin Hairer氏、Edward Witten氏など9名です(agmai.org)。

10月6日の声明では、今回の公開について「人間による理解と、数学の知識体系への取り込みの始まりであって、完了ではない」としています。あわせて、数学者が自ら問いを立て、選ばれなかった方向も探れること、研究ツールと計算資源への公平なアクセスが必要であることを強調しています。報道(ITmedia、XenoSpectrum)によると、助言は成果の重要性を判断したものでも、OpenAIのやり方を支持したものでもなく、社内モデルで問題を試す慣行は支持しないとも述べています。

研究者・関係者の発言(報道ベース)

発言者

立場

発言の要旨

Levent Alpöge氏

Anthropic所属の数学者

「明らかに数学史上最も重要な瞬間」とXに投稿。のちの投稿で留保を追加(Latent Space)

Timothy Gowers氏

フィールズ賞受賞者・AGMAIメンバー

査読を支持し、少なくとも1本はトップ誌に投稿すべきと示唆(Startup Fortune)

Terence Tao氏

フィールズ賞受賞者

AIによる証明が中身の見えないブラックボックスとして届くと、数学に害を与えかねないと警告

François Chollet氏

AI研究者

検証しやすい領域以外にも通用するのか疑問を示す(Latent Space)

Will Depue氏

AI研究者

一部の結果は精査に耐えないだろうとの見方(Latent Space)

競合のAnthropicに所属する数学者が強い言葉で評価した一方、フィールズ賞受賞者らは査読と透明性を求めています。なお、フィールズ賞受賞者25人の共同声明「A Severe Misalignment of AI in Mathematics」は、9月のナビエ–ストークス発表のときに出たもので、今回の公開に向けたものではありません。


Claude(Anthropic)の数学成果との比較

Anthropic公式リサーチ記事のイメージ。Claudeがリーマンゼータ関数の零点の下界を更新した成果

出典: Anthropic 公式リサーチ記事

同じリーマンゼータ関数でも、OpenAIとAnthropicでは発表のしかたがほぼ正反対です。OpenAIは大量の成果を一度に公開し、Anthropicは個別の成果を人間の検証を厚くしてから公表しています。

Anthropicは2026年8月10日、未公開の研究版Claudeが「ゼータ関数の非自明な零点のうち、臨界線上にあると証明できる割合」の下界を41.6%から67.2%(基礎となる定理は2/3)に引き上げたと発表しました(arXiv:2608.13637)。今回OpenAIが主張する準リーマン予想とは別の問題で、どちらもリーマン予想そのものを解いたものではありません。

比較ポイント

OpenAI(2026年10月6日公開)

Claude / Anthropic

代表的な成果

準リーマン予想(Re s > 7/8)、CMアーベル多様体のホッジ予想、ユニークゲーム予想など(主張)

ゼータ零点の臨界線上の割合の下界 41.6%→67.2%(8月)、フェルマーの最終定理の完全形式化(9月、既存の証明の検証)

規模

原稿722本・成果群372・出題約4,000問

成果を1件ずつ公表

公開先

自社GitHub(openai/math)に一括公開

arXiv論文+公式リサーチ記事+Lean形式化のGitHub

人間による検証

外部の確認は未了。人間の編集は11/12版原稿のみ明記

ゼータの成果は社内数学者2名(Alpöge氏、Furman氏)と外部専門家2名(Brian Conrey氏、Dan Goldston氏)が検討

Lean形式化

主結果ベースで162本(報道)、成果群ベースで235

ゼータの成果・フェルマーの最終定理ともにLean 4で形式化

使用モデル

名称非公開・未リリース

未公開の研究版Claude(フェルマーの最終定理は「Claude Fable 5.1相当」の社内研究モデル)

計算量の開示

平均「ChatGPT Pro思考約3時間/結果」。総額は非開示

ゼータ:約3,100万出力トークン・約60のサブエージェント(報道)/フェルマー:約60億出力トークン・11日(公式)

査読

なし

ゼータの成果も査読誌掲載前

比べるときの注意点

この表から読み取れるのは、主張の規模と大きさではOpenAI、検証の手順の丁寧さではAnthropicのゼータ成果が上回るということです。

ただし、ここから「OpenAIのAIのほうが数学が強い」「Claudeのほうが正確」と結論づけるのは早すぎます。使ったモデル、かけた計算量、どの問題を選んだかがまったく違うため、同じ条件で比べたデータがないからです。

参考になる事例として、2026年5月にOpenAIが反証したエルデシュの単位距離予想について、AnthropicのSholto Douglas氏が「Claude Mythosも別の証明で解いた」とXに投稿し、数学者のDaniel Litt氏が「OpenAIのものより少し劣る」と評価したことがあります(the-decoder報道。Anthropicの公式発表ではありません)。両社の研究モデルは、同じ問題で競える水準にあると見るのが現実的です。

Claudeの成果の詳細はClaudeはリーマン予想を解いたのか|41.6%→67.2%の意味、フェルマーの最終定理の形式化に使われたモデルはClaude Fable 5.1とは、MythosについてはClaude Mythosとはで解説しています。


2026年のAI×数学の流れ|5月から10月で一気に加速

AnthropicのAI「Claude」のロゴ。2026年はOpenAIとAnthropicが数学成果を相次いで発表した

出典: Anthropic「Claude」

今回の公開は単発のニュースではなく、半年足らずのうちにAI企業の数学成果が「1件」から「数百本」に増えた流れの中にあります。

日付(2026年)

出来事

5月

OpenAIがエルデシュの単位距離予想を反証。下旬にはAnthropic側もClaude Mythosで別証明を得たとXで投稿

8月1日

OpenAIが数学成果10件をLean付きで公開

8月10日

Anthropicが、研究版Claudeでゼータ零点の臨界線上の割合の下界を67.2%に更新したと発表

9月4日

Anthropicが、フェルマーの最終定理(Wilesの証明)をClaudeで11日・Lean約1,300万行・定理30,300個として形式化したと発表

9月8日

OpenAIがナビエ–ストークス方程式の有限時間爆発(外力あり)を発表

9月11日前後

フィールズ賞受賞者25人の共同声明

9月29日

AGMAIがAI生成数学の責任ある公開のガイドラインを公表(600件超のアンケート回答に基づく)

10月6日

OpenAIが原稿722本・成果群372を公開。同日AGMAIが声明

5月の件はOpenAIのAIが80年来の数学難問を解いた|エルデシュ予想の反証、8月の10件の成果はOpenAI Astraとはで詳しく扱っています。

「AIが難問を1つ解いた」という段階から、AIが人間の確認を待つ原稿を大量に生み出す段階に移りつつあります。今回の公開で見えてきたのは、新しい結果を生み出す速さに、人間が読んで確かめる速さが追いつかないという問題です。


「AIが証明した」という投稿を見たときの確かめ方

OpenAIが数学原稿722本を公開したGitHubリポジトリ「openai/math」。CONTENTS.mdでLeanリンクの有無を確認できる

出典: GitHub「openai/math」

SNSで「OpenAIのAIが○○予想を証明」という投稿を見かけたら、次の3つを順に確認すると、どこまで信用してよいかを自分で判断できます。

  1. GitHubのCONTENTS.mdで、その成果群に [Lean] リンクがあるか確認する

    openai/math のCONTENTS.mdでは、成果群ごとに原稿PDFとLeanページへのリンクが並んでいます。Leanリンクがなければ、機械検証の裏付けはありません。

  2. Leanがあれば、lean/docs/{番号}.md の「Scope」で形式化の範囲を確かめる

    主定理だけなのか、応用まで含むのかがここに書かれています。見出しの主張と範囲が一致しているかを見ます。

  3. 外部の数学者や査読誌の評価が出ているかを確かめる

    その分野の専門家がブログや論文で検証結果を出しているか、学術誌に投稿・受理されたかを確認します。ここまで済んで、ようやく「証明された」と言える状態に近づきます。

確認結果

信頼度の目安

伝えるときの言い方の例

Leanなし・外部評価なし

低(主張の段階)

「OpenAIが証明したと主張している」

Leanあり(範囲が限定的)・外部評価なし

中(主定理の論理は機械検証済み)

「主定理はLeanで検証されているが、専門家の確認はこれから」

Leanあり・専門家の肯定的な評価あり

中〜高

「Lean検証済みで、専門家も妥当と評価している」

査読誌に掲載

高

「査読を経て証明が認められた」


一般ユーザー・企業への影響|このAIは使えるのか

書架が並ぶ大学図書館。研究や業務で使うAIを選ぶ判断材料のイメージ

今回の成果を出したモデルは未公開で、一般ユーザーは使えません。 料金も決まっていません。現在ChatGPTで使えるモデルが、このニュースを受けて急に数学が強くなるわけではありません。

1結果あたりの目安として示された「ChatGPT Pro思考約3時間」は、現行のChatGPT Proでも同じ成果が出るという意味ではなく、計算量を換算した目安です。ChatGPT Proの受付状況はChatGPT Proの新規受付停止の解説を参照してください。

研究・業務でAIを選ぶときの判断材料

数学の成果そのものより、各社がAIの出した結果をどう検証し、どう開示しているかのほうが、研究や業務でAIを選ぶときの参考になります。

判断したいこと

今回のニュースから読み取れること

最先端の研究モデルの実力

OpenAIもAnthropicも、未公開モデルで研究レベルの結果を出せる段階にある

手元で使えるモデルの性能

未公開モデルの成果は、現行製品の性能を直接示すものではない。製品同士の比較はGPT-6 Astra vs Claude Fable 5.1の比較やClaudeとChatGPTの違いを参照

AIの出力をそのまま使ってよいか

OpenAI自身が「形式化されていない結果には誤りがあり得る」としている。業務でも、AIの出力は検証の工程を通す前提で使う

検証の仕組みの作り方

「機械で検証できる形で出力させる」「範囲を明示する」「人間の専門家が最終確認する」という3段構えは、業務AIの運用にもそのまま応用できる

未公開データの扱い

研究アイデアや草稿を個人アカウントに入れるリスクは、未公開研究データとOpenAIの信頼性で整理

ChatGPTやClaudeの基本はChatGPTとは・Claudeとは、生成AI全体の仕組みは生成AIとはで解説しています。


このニュースを詳しく追うべき人・今すぐの対応は不要な人

詳しく追うべき人

  • 数学・理論計算機科学の研究者:自分の分野の未解決問題に「解決済み」の原稿が出ている可能性があります。CONTENTS.mdで関連する成果群を確認し、必要なら検証に加わる価値があります
  • 大学・高校で数学や情報を教える教員:学生がこのニュースを見て「リーマン予想が解けた」と誤解する可能性があります。準リーマン予想との違いを説明できると役立ちます
  • 研究開発部門でAI導入を担当する人:どの会社のAIを研究に使うかを考えるとき、成果の規模だけでなく、検証の手順や開示の姿勢も比べる材料になります
  • 形式検証・Leanに関わるエンジニア:形式化の範囲の示し方や、Comparatorで第三者がチェックする仕組みは、ソフトウェア検証にも通じます
  • AI関連の情報発信をしている人:「722件を解決」「リーマン予想が証明された」は不正確な要約です。正確に伝えられるかどうかで信頼が分かれます

今すぐの対応は不要な人

  • ChatGPTやClaudeを文章作成・要約・資料作りに使っている人:成果を出したモデルは未公開で、手元のツールの使い方は変わりません
  • AIツールの導入を検討中の企業担当者:料金・日本語対応・セキュリティ・既存システムとの連携といった選定基準は、このニュースで変わりません
  • 数学の結果が確定してから知りたい人:査読や専門家の検証には時間がかかります。評価が固まるまで待つのは合理的な判断です

よくある質問

Q. 結局、リーマン予想は解けたのですか?

解けていません。OpenAIが主張しているのは「実部が7/8より大きい領域には零点がない」という準リーマン予想の証明で、リーマン予想(すべての非自明な零点が実部1/2の線上にある)よりも弱い主張です。クレイ数学研究所の賞金の対象にもなりません。

Q. 原稿722本が「すべて正しい」可能性はありますか?

OpenAI自身が、形式化されていない結果には誤りがあり得ると書いており、見つかれば修正して新しい版として記録する方針を示しています。主結果がLeanで検証されているのは報道ベースで約22%なので、残りは専門家が読んで確かめるまで正しいとも誤りとも言えません。

Q. ホッジ予想が解けたなら、ミレニアム懸賞の賞金は出るのですか?

出ません。今回の主張はCMアーベル多様体という特別なケースに限ったもので、ミレニアム懸賞問題のホッジ予想全体ではないためです。加えて賞金の審査には、査読誌への掲載とその後2年以上の期間が条件になります。

Q. なぜOpenAIはarXivではなく自社のGitHubで公開したのですか?

公式な理由は示されていません。READMEでは、コミュニティが運営するリポジトリでの公開も検討中だとしています。AGMAIはAIラボが管理しない学術リポジトリへの登録を求めており、ここは今後の対応が注目される点です。

Q. どのモデルが使われたのですか?GPT-6系ですか?

モデル名は公表されておらず、「未公開の社内モデル」とだけ説明されています。現在提供されているGPT-6系のモデルや、リリースが中止されたGPT-6.1 Astraと同じものかどうかもわかっていません。推測で結びつけるのは避けるべきです。

Q. Claudeでも同じような成果は出せるのですか?

一般向けのClaudeでは、同じ規模の成果は出せません。Anthropicの数学成果も、未公開の研究版Claudeを使ったものです。ただし、エルデシュの単位距離予想ではClaude Mythosも別の証明にたどり着いたとAnthropic関係者が投稿しており、両社の研究モデルは近い水準にあると考えられます。

Q. 数学者の仕事はなくなるのですか?

現時点では、むしろ確認する側の仕事が増えています。722本の原稿のうち、人間がきちんと読んで確かめたものはまだ一部です。AGMAIも「数学者が自分で問いを立て、選ばれなかった方向を探れること」が必要だと強調しています。結果を生み出す役割の一部はAIに移りつつありますが、正しいかを判断し、数学の知識として組み込む役割は人間に残ります。


まとめ

  • OpenAIが2026年10月6日に公開したのは、未公開の社内AIによる数学原稿722本・成果群372。「未解決問題を722件解決」は誤りで、OpenAIの主張は「100件超を解いた」
  • 目玉は準リーマン予想(Re s > 7/8 に零点がない)とCMアーベル多様体のホッジ予想。リーマン予想やホッジ予想全体、ナビエ–ストークスのミレニアム問題が解けたわけではない
  • 主結果がLeanで機械検証されているのは約22%(162本)。ホッジ予想をはじめ、大きな主張ほどLeanがない傾向がある
  • 信頼性の論点は、形式化率の低さ・形式化の範囲の限定・モデルとプロンプトの非公開・査読前の自社公開の4つ
  • Claudeの数学成果と比べると、規模はOpenAI、検証手順の丁寧さはAnthropic。ただし条件が違うため、AIとしての優劣はこれだけでは決まらない

AGMAIが言うとおり、今回の公開は「始まりであって完了ではない」段階です。どの成果が本物かは、これから数か月〜数年かけて専門家の検証で絞り込まれていきます。続報を追うときは、Leanの有無と専門家の評価という2点を確認すると、見出しに振り回されずに済みます。

このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します

業務を1つ送る

この記事の著者

AI革命

AI革命

編集部

AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。

経理・事務作業・開発を、AI革命にまとめて任せられます

ご相談は無料です。オンラインで完結します