AIツール2026年8月更新

GLM-5.3-Flashとは?320B/18BのMoE・MIT公開・料金1/10と中国製チップ推論の実像【2026年8月最新】

公開日: 2026/08/27
更新日: 2026/08/28
GLM-5.3-Flashとは?320B/18BのMoE・MIT公開・料金1/10と中国製チップ推論の実像【2026年8月最新】

この記事のポイント

GLM-5.3-Flashは、Z.aiが2026年8月26日にMITライセンスで公開した320B/18BのMoEモデル。スペック、上位機GLM-5.3とのライセンス差、定価とプロモ価格、中国製チップ推論の検証状況を整理します。

GLM-5.3-Flash(ジーエルエム・ファイブポイントスリー・フラッシュ)は、中国のZ.ai(智譜AI/Zhipu)が2026年8月26日にMITライセンスで公開した、総パラメータ320B・トークンあたりアクティブ18BのMoE型オープンウェイトモデルです。 GLM-5シリーズで初めて画像・動画をネイティブに扱い、上位機のGLM-5.3に対しておよそ10分の1の単価で提供されている点が最大の特徴です。

もう一つ、このモデルが技術ニュースとして扱われた理由があります。Z.aiはこのモデルのオンライン推論をNVIDIA GPUではなく中国製AIチップ約10万基のクラスタで処理し、NVIDIA環境と同等のトークン単価を実現したと説明しました。ただしこの主張は現時点で第三者検証されていません。加えて、話題になった単価「$0.075」は2026年9月9日で終わる期間限定価格です。この2点を取り違えると、技術評価もコスト試算も丸ごと狂います。

この記事でわかること

  • GLM-5.3-Flashの基本スペックと設計(320B-A18B/100万トークン級/ネイティブマルチモーダル)
  • 上位機GLM-5.3との違い — 価格・規模・ライセンスの決定的な差(2026年8月29日に状況が変わりました)
  • なぜ1/10の単価が成立するのか(ハイブリッドアテンションほかの設計)
  • 中国製AIチップでの推論という主張のうち、何が確認できて何が未検証か
  • 定価とプロモ価格の区別、月間トークン量別のコスト試算
  • API・OpenRouter・Coding Plan・セルフホストの4ルートと必要スペック
  • 日本企業が業務利用を判断するときの確認項目

想定読者: 安価な高性能モデルを探している開発者、GLMシリーズの使い分けを決めたい人、社内でAIモデルの利用可否を判断する情報システム部門・調達担当の方。

なお、発表前に「Ox Alpha」という匿名名でOpenRouter・OpenCodeに登場し、コーディング用途で処理量1位を取ってから正体が明かされるまでの経緯は、Ox Alphaとは?正体はGLM-5.3-Flashと判明で詳しく追っています。本記事はモデル本体のスペック・料金・導入判断に絞ります。

GLM-5.3-Flashとは — Z.aiがMITで公開した320B/18BのMoEモデル

Z.ai公式ドキュメントに掲載されたGLM-5.3-Flashのモデルページ

出典: Z.ai 公式ドキュメント

GLM-5.3-Flashは、コーディング・長時間のエージェント作業・防御的なセキュリティ検証を主用途として設計された、低コスト帯の推論モデルです。Z.ai公式はGLM-5シリーズにおける「初のネイティブマルチモーダルモデル」と位置づけており、テキストだけでなく画像・動画・ファイルを1パスで処理できます。

項目

内容(2026年8月29日時点)

モデル名

GLM-5.3-Flash(APIモデルコード glm-5.3-flash

開発元

Z.ai(智譜AI/Zhipu AI、北京。香港上場)

発表日

2026年8月26日

アーキテクチャ

MoE(Mixture-of-Experts)/総パラメータ 320B・アクティブ 18B(320B-A18B)

ライセンス

MIT(Hugging Face zai-org/GLM-5.3-Flash で重み公開)

入力

テキスト・画像・動画・ファイル(ネイティブ処理)

出力

テキストのみ

コンテキスト長

公称 1,048,576トークン(約100万)※提供経路で表示が異なる

最大出力

128Kトークン(Z.ai公式ドキュメントに明記)

事前学習

30兆トークン規模のマルチモーダルコーパス

主用途(公式)

コーディング、防御的サイバーセキュリティ、長期的なエージェントタスク

発表前の名称

Ox Alpha(OpenRouter/OpenCode上での先行公開名)

コンテキスト長には情報の食い違いがあります。Z.ai公式ドキュメントとUnslothは1,048,576トークンとする一方、OpenRouterの表示は1,310,720トークン、Hugging Faceのモデルカードにある評価注記には30万トークンという記述があります。最大出力も、Z.ai公式は128Kですが、HFモデルカードの評価設定は163,840、OpenRouterの表示は131,072です。「公称100万トークン級。実際の上限は利用するプロバイダの仕様で確認する」と捉えるのが実務的です。

先行公開されていた「Ox Alpha」との関係

2026年8月20日ごろ、OpenRouterとOpenCodeに開発元非公開のモデル「Ox Alpha」が無料で登場しました。約1週間で両プラットフォーム合計62兆トークンを処理し、OpenRouterでは週間総量の約31%(10.3兆トークン)を占めてコーディング用途で1位に立ったとSCMPが報じています。8月26日、Z.aiが公式Xで "Previously previewed as Ox Alpha" と明かし、正体が確定しました。

一部の海外記事にある「1日100兆トークン」という数字は裏付けが取れません。確認できるのは「1週間で62兆トークン」までです。この期間の詳しい経緯、無料プレビュー終了後の移行手順、当時のサービス不安定化についてはOx Alphaとは?正体はGLM-5.3-Flashと判明を参照してください。

ライセンスが分かれた — Flashは MIT、GLM-5.3 は独自ライセンス

2026年8月29日にGLM-5.3(上位機)のオープンウェイトも公開され、GLMシリーズは「両方とも重み公開済み、ただしライセンスの性質が違う」状態になりました。 社内稟議で最も誤解されやすいのがこの差です。

項目

GLM-5.3-Flash

GLM-5.3(上位機)

重みの公開

2026年8月26日(発表と同日)

2026年8月29日(安全性評価のため約2週間遅れて公開)

ライセンス

MIT

独自の「GLM-5.3 License」

商用利用

制限なし

原則無償で利用・改変・再配布・派生物作成が可能

追加条件

なし

「Model as a Service」事業者で、直近連続12か月の合計収益が100億ドルを超える場合、商用展開前にZ.AIのセキュリティレビューが必要

公開先

Hugging Face zai-org/GLM-5.3-Flash

Hugging Face / ModelScope zai-org/GLM-5.3

GLM-5.3 Licenseの条件は、実際のライセンス本文で確認できます。

  1. 「MaaS(Model as a Service)」に該当するのは、APIなどで第三者に推論やファインチューニングの実質的な制御を提供する事業です。エンドユーザー向け製品にモデルを組み込むだけの場合や、外部ホスト型モデルへリクエストを中継するだけのサービスは該当しないと明記されています。
  2. 審査義務が発生する収益基準は100億ドル(直近12か月の合計収益)。日本企業でこの規模のMaaS事業者に該当するケースは極めて限られます。
  3. とはいえ、「GLMシリーズはすべてMIT」と社内説明すると不正確になります。ライセンス条項の照会先として glmlicense@z.ai が案内されています。

Flash(MIT)が発表と同日に無条件公開されたのに対し、GLM-5.3が安全性評価を経て独自ライセンスになった背景には、サイバーセキュリティ能力の高さがあります。GLM-5.3は開発中に269のOSSプロジェクトで2,436件の脆弱性を発見し、うち1,097件が高〜重大と判定されたと報じられています。上位機側の詳細な性能・料金・この安全性評価の中身はGLM-5.3とは?Z.ai最新モデルの性能・料金にまとめています。

実務的な結論としては、「オンプレに置いて自由に商用展開したい」ならFlash(MIT)のほうが法務確認が軽い、ということになります。オープンウェイト公開そのものをどう評価するかという議論はAnthropicのオープンウェイトモデルへの立場も参考になります。

混同注意:GLM-5.3とGLM-5.3-Flashは別モデル

GLM-5.3-Flashは、GLM-5.3の「高速版」ではなく、規模も価格帯も設計思想も異なる別モデルです。名前が1語しか違わないため、料金表を読み違えるケースが多発しています。

項目

GLM-5.3(上位機)

GLM-5.3-Flash

位置づけ

フラッグシップ。精度優先

低コスト・大量稼働向け

規模

総パラメータ 約744〜753B/アクティブ 40B

総パラメータ 320B/アクティブ 18B

入力モダリティ

テキスト中心

テキスト・画像・動画・ファイル

入力単価

$1.4 / 100万トークン

$0.15 / 100万トークン

出力単価

$4.4 / 100万トークン

$0.50 / 100万トークン

キャッシュ入力

$0.26 / 100万トークン

$0.03 / 100万トークン

Coding Planのクレジット消費(出力)

24倍

8倍

Coding Planの利用枠

標準

GLM-5.3の約3倍

ライセンス

GLM-5.3 License(独自)

MIT

Artificial Analysis Intelligence Index

60

57

※料金はZ.ai公式の料金ページに記載された定価(2026年8月29日時点)。GLM-5.3のパラメータ数は報道が744B/40B、Hugging Faceのモデルカード表示が753Bと表記差があります。

Z.ai自身は価格について「GLM-5.2比でおよそ1/10」と表現しています。GLM-5.2は入力$1.4/出力$4.4だったため、実数は入力で約1/9.3、出力で約1/8.8です。「1/10」は概算表現である点は押さえておいてください。前世代の内容はGLM-5.2とは?料金・性能とコスト1/6の実態、シリーズの系譜はGLM-5.1とはで整理しています。

なぜ1/10の単価が成立するのか — アーキテクチャの中身

価格の安さは値引きではなく、推論時の計算量とメモリ消費を構造的に削った結果です。Z.aiは技術レポートで、GLM-5.3比でアテンション計算を約3.0倍削減、KVキャッシュを約4.4倍削減したと説明しています。

公表されている主な設計は次の通りです。

  • スパースアテンションと線形アテンションのハイブリッド構成 — Z.aiは「オープンウェイトのフロンティアモデルとしては初」と説明。45層の言語モデルで、KDA(線形アテンション)層とNoPEスパースMLA層をインターリーブする構成
  • MoEルーティング — 288エキスパートのうち、各トークンで使うのは8つのみ。総パラメータ320Bに対し、実際に動くのは18B
  • IndexPool圧縮 — 100万トークン級の長文脈を扱う際のインデックスを圧縮
  • ネイティブFP8重み — 学習時点からFP8。推論時の変換ロスとメモリを削減
  • MTP(Multi-Token Prediction)ドラフト層 — 投機的デコードによる高速化
  • mHC(Manifold-Constrained Hyper-Connections) — スケーリング効率の改善

重要なのは、KVキャッシュのサイズが長文脈のコストを直接左右するという点です。100万トークンの文脈を保持し続けるコストが下がったからこそ、大量のトークンを流すエージェント用途で単価を下げられます。

ただしZ.ai自身が技術レポート内で、KVキャッシュのサイズはKimi K3やDeepSeek-V4-Flashと比べるとまだやや大きく、改善余地があると認めています。同種の設計で先行するモデルとの比較はKimi K3とは?料金・性能比較DeepSeek V4 Flashとはもあわせて見ると位置づけが掴めます。

中国製AIチップ10万基での推論 — 供給側で何が起きているのか

このモデルが単なる「安いモデル」で終わらないのは、Z.aiが「NVIDIA GPUを一切使わずに、NVIDIA環境と同等のトークン単価でこれを提供している」と主張しているからです。 事実であれば、輸出規制下でも中国側が推論供給を自前で回せることを意味し、AI推論の価格競争そのものに影響します。

一方で、報道ごとに書かれている内容にばらつきがあります。確認できる範囲を切り分けます。

論点

確認できること

注意点

推論クラスタ

Ox Alpha期間を含むオンライン推論を、国産チップ約10万基のクラスタで処理。NVIDIA GPU不使用とZ.aiが説明

具体的なチップベンダー名は非公表(CNBC・SCMPとも「Z.aiは回答しなかった」と明記)

Huawei Ascend 910B

前世代GLM-5の学習時に関する情報

Flashの推論クラスタの内訳としては未確認。断定しない

コスト効率

「NVIDIA GPUに匹敵するトークン単価」はZ.ai側の主張

第三者による独立検証はされていない(TechTimesは "unverified" と明記)

推論基盤

SGLangをベースに自社推論エンジンを構築。同一ハードで初期比約3倍のサービング性能に到達したと説明

数値はZ.ai公表値

市場反応

発表後、香港市場でZ.ai株が急騰

上昇率は8%(CNBC)〜12%超(SCMP・Quartz)と報道差がある

つまり、「中国製チップだけで動いている」という説明はZ.aiが公式に明言したものですが、どのメーカーのチップかは公表されておらず、コスト効率の主張も独立検証されていません。 「Ascend 910B搭載」と書いている記事を見かけますが、それは世代も用途(学習)も異なる話です。

供給側の論点は、価格の持続性と調達リスクの2つに集約されます。

  1. 価格の持続性が読みにくい。 自社クラスタで回している以上、プロモ終了後の値付けはZ.aiの調達コスト次第で動きます。長期契約前提のコスト計画には向きません。
  2. 調達リスクが単価に転嫁される可能性がある。 国産チップへの依存は、輸出規制の影響を受けにくい一方で、供給元が特定されないままの運用でもあります。可用性のSLAを重視する用途では、複数プロバイダ経由(OpenRouterなど)で冗長化しておくのが現実的です。

中国製チップで学習・推論まで完結させた事例としてはMeituanのLongCat-2.0が先行しています。なぜ中国製モデルが実利用で選ばれているのかという需要側の背景は中国製AIモデルがOpenRouter利用の60%超えで扱っています。

性能はどのくらいか — 勝っている項目と、届いていない項目

Hugging Faceで公開されたGLM-5.3-Flashのモデルカード

出典: Hugging Face — zai-org/GLM-5.3-Flash

エージェント系・ツール利用系のベンチマークでは最上位クラスに肉薄する一方、絶対的な天井と出力速度では上位モデルに届いていません。 第三者計測(Artificial Analysis)のIntelligence Indexは57で、同サイトのオープンウェイトモデル111件中4位、全体では10位前後と報道されています。同クラスの中央値は29なので、価格帯からすると突出した水準です。

上位クラスに並んでいる項目

ベンチマーク

GLM-5.3-Flash

比較対象

Artificial Analysis Intelligence Index

57

Claude Opus 4.8と同水準。オープンウェイト111件中4位(上位機GLM-5.3は60)

Toolathlon-Verified

78.4

7モデル中1位

DeepSWE v1.1

63.4

GLM-5.2: 46.2(約1.4倍)

AutomationBench

48.8

GLM-5.2: 26.2(約1.9倍)

Z.ai Code Bench v1.0

29.0

Claude Opus 4.8: 29.5

MMVU(動画理解)

80.5

OfficeQA Pro(視覚)

62.4

届いていない項目

項目

GLM-5.3-Flash

上位モデル・母集団

Terminal-Bench 2.1

84.3

GPT-5.6 Terra: 87.4 / Gemini 3.7 Flash: 85.8 / Claude Opus 4.8: 85.0

HLE(ツール使用あり)

55.3

183モデル中15位

出力速度

49.4トークン/秒(Z.ai提供時)

111モデル中48位。同クラス中央値より明確に遅い

出力トークン量

150M(AA評価全体)

中央値110M。冗長寄り

この数字の読み方には注意が要ります。

  1. 「安いのに近い」であって「最強」ではない。 Terminal-Bench 2.1では上位3モデルに届いていません。差は数ポイントですが、単価が1/10近いことを踏まえた評価が実態に合います。
  2. 速度の弱点は「初回応答」ではなく「吐き終わるまで」。 Artificial Analysisの計測では、TTFT(初回トークンまでの時間)は1.49秒と速い部類です。体感の待ち時間が伸びるのは、思考トークンを長く吐き、出力速度が49.4 t/sと遅いことの組み合わせによります。「初回応答に数十秒かかる」という記述を見かけますが、現行の計測値とは一致しません。
  3. プロバイダによって速度が変わる。 同じモデルでもホスト先で出力速度に差が出ます。速度が要件なら提供元の選択が効きます。

なお、日本語性能の公式ベンチマーク値は現時点で公開されていません。 JGLUEなどの公表数値は確認できませんでした。個人検証のレポートは存在しますが、母数の小さい参考値として扱うのが妥当です。同価格帯の直接的な競合としてはQwen3.8-Flash-Next(125B-A6B)、安価マルチモーダルではDeepSeek V4 Flash Vision、Intelligence Indexでの比較対象はDeepSeek V4 Proとはも参照できます。

料金 — 定価とプロモ価格を必ず分けて考える

Z.ai公式ドキュメントの料金ページ

出典: Z.ai 公式ドキュメント — Pricing

出回っている「入力$0.075」は50%OFFのプロモーション価格で、2026年9月9日24:00(UTC+8/日本時間9月10日1:00ごろ)に終了予定とZ.ai公式の料金ページに明記されています。 予算は定価ベースで組んでください。

項目

定価

プロモ価格(〜2026/9/9)

入力

$0.15 / 100万トークン

$0.075

キャッシュ入力

$0.03 / 100万トークン

$0.015

出力

$0.50 / 100万トークン

$0.25

キャッシュ入力のストレージ料金は、現時点では期間限定で無料とされています。

月間トークン量別のコスト試算(定価ベース)

入出力比を5:1と仮定した場合の概算です。実際には思考トークンが出力側に乗るため、出力量は想定より膨らみやすい点に注意してください。

月間利用量

GLM-5.3-Flash(定価)

GLM-5.3(定価)

入力1,000万+出力200万

約 $2.5

約 $22.8

約1/9

入力1億+出力2,000万

約 $25

約 $228

約1/9

入力10億+出力2億

約 $250

約 $2,280

約1/9

プロモ価格が適用されればさらに半額になりますが、9月9日を過ぎれば自動的に定価へ戻ります。Artificial AnalysisがIntelligence Indexを完走した際のコストは、定価換算で1タスクあたり約$0.09、プロモ適用時で約$0.045でした。「$0.045で回る」という数字を見たら、それは割引後の値だと理解してください。

GLM Coding Plan(定額サブスク)

Z.ai公式ドキュメントのGLM Coding Plan概要ページ

出典: Z.ai 公式ドキュメント — GLM Coding Plan

毎日エージェントを回すなら、従量課金よりサブスクのほうが読みやすくなります。GLM-5.3-Flashは全ティアで利用可能で、GLM-5.3に対して約3倍の利用枠が割り当てられます。

ティア

月額の目安

5時間あたりクレジット

週次クレジット

Lite

$18〜

2,000

10,000

Pro

約$72〜80

12,000

60,000

Max

約$160〜168

28,000

140,000

※Lite以外は媒体によって$72/$160、$80/$168と表記が分かれています。契約前に公式ページで確認してください。

クレジットの消費倍率も上位機と差があります(公式devpackドキュメント)。

  • GLM-5.3: 入力6.9倍/キャッシュ入力1.7倍/出力24倍
  • GLM-5.3-Flash: 入力2.3倍/キャッシュ入力0.56倍/出力8倍

加えて、月〜金14:00〜18:00(シンガポール時間)以外の時間帯と週末終日はクレジット消費が50%になるオフピーク割引があり、従量課金と比べて最大92%節約できるとZ.aiは説明しています。旧モデルを指定していた場合、GLM-5.2/GLM-5.1へのリクエストはGLM-5.3へ、GLM-5-Turbo/GLM-4.7へのリクエストはGLM-5.3-Flashへ自動ルーティングされます。

サードパーティ経由の価格

提供元

モデルID

入力/出力(100万トークン)

備考

OpenRouter

z-ai/glm-5.3-flash

$0.075 / $0.25

プロモ価格が反映。プロバイダ18社から自動ルーティング

Cloudflare Workers AI

@cf/zai-org/glm-5.3-flash

$0.15 / $0.50

GLMファミリー初のマルチモーダル対応モデルとして2026年8月26日提供開始。Workers無料プランでは利用不可

Baseten / Together / Novita / Modal / Dell Enterprise Hub ほか

提供元による

速度重視ならプロバイダ差を確認

OpenRouter経由の提供社数は当初の13社から18社へ増えています。ルーティング先で速度もログ保持ポリシーも変わるため、要件がある場合はプロバイダを指定してください。プラットフォームの仕組みはOpenRouterとは?料金・手数料・使い方、運営体制の変化はStripeによるOpenRouter買収で解説しています。

使い方 — 4つの利用ルート

OpenRouterに掲載されたZ.ai提供モデルのページ

出典: OpenRouter — Z.ai

ルート

何が良いか

コスト

向くケース

① Z.ai公式API

一次提供元。仕様変更が最も早く反映される

定価$0.15/$0.50(プロモ中は半額)

公式仕様どおりの挙動で揃えたい

② OpenRouter

モデルIDの差し替えだけで移行できる。プロバイダを選べる

同上

複数プロバイダで冗長化したい

③ GLM Coding Plan

定額。Flashは枠が3倍でオフピーク割引もある

月$18〜

毎日エージェントを長時間回す

④ セルフホスト(MIT)

データを外に出さずに済む

GPU費用(FP8で約306GiB規模)

機密データを扱う企業

API利用時に押さえる設定

Z.ai公式APIはOpenAI互換で、function calling(tools / tool_choice)、JSON出力、ストリーミング(stream / tool_stream)に対応しています。公式は stream: truetool_stream: true の併用を推奨しています。設定面で効いてくるのは、思考量・サンプリング・思考モードの扱いです。

  1. reasoning_effort で思考量を low / high / max の3段階に調整できる。 公式推奨は max ですが、コストとレイテンシは上がります。コスト最適化の第一手はここを下げることです。
  2. サンプリングは temperature = 1top_p = 0.95 が公式推奨。
  3. 思考モードはオフにできない。 thinking.typeenabled のみのサポートです。短い応答でも思考トークンが乗るため、max_tokens を小さくすると本文が残らないことがあります。なお thinking.clear_thinking の推奨値は公式ドキュメントとHugging Faceのモデルカードで記述が食い違うため、利用する経路のドキュメントで確認してください。

画像入力は type: image_url(URLまたはBase64 Data URL)で渡し、複数画像はコンテンツブロックを並べます。視覚能力がコーディングのループに統合されているため、スクリーンショットや画面録画を渡してUIの不具合を特定させる、といった使い方ができます。Z.ai側のZCode環境ではBrowser Use / Computer Useとの組み合わせも案内されています。

セルフホスト・ローカル実行の現実

Hugging Faceのzai-org組織ページ。GLMシリーズの重みが公開されている

出典: Hugging Face — zai-org

「MIT公開=手元のPCで動く」ではありません。 FP8重みでのサーバ自己ホストには約306GiB、NVIDIA Hopper世代以降で最低8GPUノードが推奨とされています。Unslothが公開しているGGUF量子化版でも、必要量は次の通りです。

量子化

サイズ

精度保持

必要メモリ(RAM+VRAM合計)

1-bit(UD-IQ1_S)

93 GB

71%

約100 GB

2-bit(UD-Q2_K_XL)

109 GB

78%

約115 GB

3-bit(UD-IQ3_XXS)

120 GB

82%

約128〜150 GB

4-bit(UD-Q4_K_XL)

200 GB

93%

約162〜210 GB

BF16(基準)

642 GB

100%

現実的な下限は3-bit(120GB)で、128GBクラスのユニファイドメモリを積んだMacやNVIDIA DGX Sparkに載るラインです。実用精度を保つ4bitでは約200GBが必要で、一般的なPCでは動きません。

実行環境で注意すべき点が2つあります。

  • 本家のllama.cppは glm5_next アーキテクチャにまだ統合されていません。 現状の実行経路はUnslothのブランチ+動的GGUF、またはUnsloth Desktopアプリです。
  • LM Studioは2026年8月28日にBionicプラットフォームへGLM-5.3-Flashを追加し、M5 Max/M5 Ultra搭載Macでのローカル実行に対応しました。個人が最も手数少なく試せる経路は現時点でここです。

サーバ側ではSGLang、vLLM、Transformers、KTransformersが対応しています。

実務で引っかかりやすい制約

制約

内容

対処

思考モードを無効化できない

thinking.typeenabled のみ。短い応答でも出力トークンが増える

reasoning_effort を下げる/低レイテンシ用途は別モデルを併用

出力が遅く、かつ冗長

49.4 t/s(111モデル中48位)。出力トークン量も中央値の約1.4倍

非同期処理にする/速いプロバイダを選ぶ

max_tokens を絞ると空応答になりうる

思考トークンが出力枠を消費するため

出力枠は余裕をもって設定する

出力はテキストのみ

画像・動画は入力のみ対応

画像生成は別モデルへ

コンテキスト長・最大出力の表示ゆれ

公称100万/OpenRouterは131万。最大出力も128K/131,072/163,840と経路差

利用するプロバイダの仕様を確認する

上位機の完全な上位互換ではない

公称はGLM-5.2比の改善。GLM-5.3との全項目比較は公式に未提示

精度が最優先の工程は上位機と使い分ける

KVキャッシュ効率

Kimi K3・DeepSeek-V4-Flashより大きいとZ.aiが自認

極端に長い文脈を常時保持する設計は要検証

無料プランでの利用不可(Cloudflare)

Workers AIはPaidプランまたはAI Gatewayクレジットが必要

事前に課金設定を確認する

ローカル実行の対応状況

本家llama.cppは未対応。GGUFは4bitで約200GB

LM Studio(M5 Max/Ultra)またはUnslothブランチを使う

日本企業が導入判断するときの確認項目

GLM-5.3-Flashの評価が分かれるのは性能ではなく、データがどこへ行くかという点です。 API経由で使う限り、プロンプトは中国拠点のZ.ai(または各プロバイダ)のクラウドへ送信されます。技術的な優劣ではなく、社内規程・取引先との秘密保持契約・輸出管理の問題として扱う必要があります。

実務では次の順序で確認していくと手戻りが減ります。

  1. どのデータを渡すのかを機密度で切り分ける。 公開情報・ダミーデータ・社内一般文書までなら判断は軽くなります。顧客データ、個人情報、未公開のソースコード、認証情報は原則として外部モデルへ送らない前提で設計します。
  2. どのルートで使うのかを決める。 同じモデルでも、Z.ai直・OpenRouter経由・Cloudflare経由でデータの保持ポリシーと準拠法が変わります。OpenRouterはプロバイダごとにログ保持の扱いが異なるため、ルーティング先の制限まで設定して初めて要件を満たせます。
  3. ライセンスを正しく社内説明する。 Flashは MIT で追加条件なしですが、上位機のGLM-5.3は独自ライセンスで、大規模MaaS事業者にはセキュリティ審査の条項があります。「GLM=全部MIT」と稟議に書くと、法務レビューで差し戻される可能性があります。
  4. 要件が厳しいならセルフホストを検討する。 MITで重みが公開されている以上、自社または国内クラウドで動かす選択肢があります。ただしGPU要件は高く、FP8で約306GiB規模です。
  5. モデル利用ポリシーそのものを見直す。 先行公開期間中は、提供元が非開示のモデルへ大量の業務データが流れていました。「誰が運用しているか」「保持ポリシーはどうか」「いつ終了するか」を確認する社内ルールがないと、同じことは今後も起きます。生成AI全般の管理方針は生成AIのセキュリティ対策で整理しています。
  6. 価格前提が変わることを見込む。 50%OFFプロモは2026年9月9日で終了予定です。稟議に載せる金額は定価ベースにしておくと、後から差し戻しになりません。

用途別の使い分け

用途

推奨

理由

大量のトークンを流すエージェント常時稼働

GLM-5.3-Flash

出力$0.50でTerminal-Bench 84.3という単価対性能

精度が最優先の設計・難易度の高い改修

上位機(GLM-5.3など)や海外フロンティアモデル

天井性能で数ポイント上回る

対話UI・カスタマーサポート

別モデル

思考オフ不可・出力が冗長で、応答完了まで待つ

画面録画・スクリーンショットを含む検証

GLM-5.3-Flash

ネイティブに動画・画像を入力できる

機密データを含む社内利用

セルフホスト版

重みがMITで公開されており、追加条件がない

個人が手元で試したい

LM Studio(M5 Max/Ultra Mac)

3bit量子化なら128GBクラスで動く

こんな人におすすめ

  • エージェントを長時間・大量に回している開発者 — トークン消費が多いほど、単価差がそのまま月額差になります
  • 大規模リポジトリを丸ごと読ませたい人 — 100万トークン級の文脈で、複数ファイルにまたがる把握やリファクタに使えます
  • 画像・動画入力を含む検証をしたい人 — GLM-5シリーズで初めてネイティブに対応しました
  • 上位機ではコストが合わなかった人 — Intelligence Indexの差は57対60で、単価は約1/9です
  • オンプレでモデルを持ちたい企業 — MITライセンスで、上位機のような追加条件もありません

おすすめしない人

  • 即応性が必要なリアルタイム対話を作りたい人 — 思考モードを切れず、出力速度も49.4 t/sと遅めです
  • 精度の絶対値で最上位を求める人 — Terminal-Bench 2.1ではGPT-5.6 Terra・Claude Opus 4.8に届いていません
  • 中国企業のAPIへ業務データを送ることが規程上NGな組織 — セルフホスト、または国内・米国系ベンダーを検討してください
  • 一般的なPCでオープンウェイトを動かしたい個人 — 4bit量子化でも約200GB、実質的な下限でも128GBクラスが必要です
  • 日本語性能の公表値を根拠に判断したい人 — 現時点で公式の日本語ベンチマーク値は公開されていません

よくある質問

Q. GLM-5.3-Flashは無料で使えますか。

Ox Alpha名義での無料プレビューは終了しています。現在は有料提供で、2026年9月9日までの50%OFFプロモ価格が実質的に最も安く試せる方法です。Hugging Faceの重み自体はMITライセンスのため、十分なメモリを積んだ環境があれば無償で動かせます。

Q. GLM-5.3とライセンスは同じですか。

違います。GLM-5.3-FlashはMITですが、2026年8月29日に公開されたGLM-5.3の重みは独自の「GLM-5.3 License」です。原則自由に使えますが、直近12か月の合計収益が100億ドルを超えるMaaS事業者は商用展開前にZ.AIのセキュリティレビューを受ける必要があります。

Q. GLM-5.3より性能が高いのですか。

いいえ。Artificial AnalysisのIntelligence IndexはFlashが57、GLM-5.3が60です。Z.aiが公表しているのも「GLM-5.2比での改善」であり、GLM-5.3との全項目比較は提示されていません。

Q. 本当に中国製チップだけで動いているのですか。

Z.aiは、オンライン推論を国産チップ約10万基のクラスタで処理しNVIDIA GPUは使っていないと説明しています。ただし具体的なチップベンダー名は公表されておらず、コスト効率の主張も第三者検証はされていません。Huawei Ascend 910Bという記載を見かけますが、それは前世代GLM-5の学習に関する情報です。

Q. 初回応答に数十秒かかるという話を見ましたが本当ですか。

現行のArtificial Analysisの計測では、TTFT(初回トークンまでの時間)は1.49秒で速い部類です。待ち時間が長く感じられるのは、思考トークンを長く吐くうえ出力速度が49.4 t/sと遅いためで、初回応答そのものが遅いわけではありません。

Q. レスポンスを速くする方法はありますか。

reasoning_effort を下げると思考トークンが減り、待ち時間とコストの両方が下がります。OpenRouter経由でホスト先を変えるのも有効です。

Q. コンテキストは本当に100万トークンありますか。

Z.ai公式ドキュメントとUnslothは1,048,576トークンとしていますが、OpenRouterの表示は1,310,720トークン、Hugging Faceのモデルカードには30万トークンという記述もあります。利用する提供元の仕様を確認してください。

Q. Claude CodeやOpenClawなどのツールから使えますか。

OpenAI互換APIのため、エンドポイントとモデルIDを差し替えられるツールであれば利用できます。GLM Coding Planを契約すると、対応ツール向けの接続方法が公式ドキュメントで案内されています。

Q. プロモが終わると何が変わりますか。

入力$0.075→$0.15、出力$0.25→$0.50、キャッシュ入力$0.015→$0.03と、いずれも2倍になります。2026年9月9日24:00(UTC+8)で終了予定です。

まとめ

GLM-5.3-Flashは、安さの理由と価格前提の期限を分けて理解すると判断を誤りません。

  • Z.aiが2026年8月26日にMITで公開した320B/18BのMoEモデル。 GLM-5シリーズ初のネイティブマルチモーダルで、最大出力は公式で128Kトークンです
  • 上位機GLM-5.3とはライセンスが違う。 GLM-5.3の重みも8月29日に公開されましたが、そちらは独自ライセンスで大規模MaaS事業者に審査条項があります。Flashは MIT で追加条件なしです
  • 安さの理由は設計。 ハイブリッドアテンションとMoEにより、アテンション計算約3.0倍・KVキャッシュ約4.4倍の削減を公称しています
  • 中国製AIチップでの推論はZ.aiの主張であり、独立検証はされていない。 供給の持続性を前提にした長期のコスト計画は避けるのが無難です
  • 話題の$0.075はプロモ価格。 2026年9月9日24:00(UTC+8)で終了予定のため、試算は定価(入力$0.15/出力$0.50)で行うのが安全です

導入を検討するなら、扱うデータの機密度を切り分け、そのうえでZ.ai直・OpenRouter・Coding Plan・セルフホストのどれを使うかを決める順序が実務的です。料金とライセンスの条件は動きが早いため、発注前にZ.ai公式の料金ページと利用するプロバイダのモデルページで最新の数字を確認してください。

モデル全体の選び方は生成AIツールおすすめ比較、エージェントの設計思想はAIエージェントとは?仕組み・種類・活用例もあわせてご覧ください。

このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します

業務を1つ送る

この記事の著者

AI革命

AI革命

編集部

AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。

経理・事務作業・開発を、AI革命にまとめて任せられます

ご相談は無料です。オンラインで完結します