AIツール2026年10月更新

ELYZA-Thinking-1.0とは?LLM-jp-4ベースの国産推論モデル・33B/32B-A3Bの性能・使い方・LLM-jp-4.1比較【2026年10月】

公開日: 2026/10/03
ELYZA-Thinking-1.0とは?LLM-jp-4ベースの国産推論モデル・33B/32B-A3Bの性能・使い方・LLM-jp-4.1比較【2026年10月】

この記事のポイント

ELYZA-Thinking-1.0(llm-jp-4版)は、国内でゼロから事前学習されたLLM-jp-4をベースにELYZAが開発した日本語推論モデルです。33B/32B-A3Bの違い、LLM-jp-4.1との項目別比較、vLLMでの使い方、必要GPU、導入時の注意点を公式情報をもとにまとめました。

ELYZA-Thinking-1.0(llm-jp-4版)は、KDDIグループのELYZAが2026年10月2日に公開した日本語特化の推論モデルです。国立情報学研究所(NII)が国内でゼロから事前学習した国産オープンLLM「LLM-jp-4」をベースにしており、33B(Dense)と32B-A3B(MoE)の2モデルがApache 2.0で無料公開されています。

ELYZAの公表値では、同サイズのLLM-jp-4.1を総合平均で上回りました。特に日本語の知識QAと細かい指示への追従で高いスコアを出しています。ただし33Bは数学とツール呼び出しで4.1に負けており、Qwen3.5やGemma 4といった海外の最新オープンモデルには総合平均で約6〜10ポイント届きません。得意・不得意がはっきりしたモデルです。

この記事でわかること

  • ELYZA-Thinking-1.0(llm-jp-4版)の基本スペックと、2025年版(Qwenベース)との違い
  • 「完全国産基盤」という表現が指している範囲
  • 33Bと32B-A3Bの違いと選び方
  • LLM-jp-4.1・Qwen3.5・Gemma 4との項目別の性能比較
  • vLLM/Transformersでの使い方、必要なGPUの目安
  • 導入前に押さえておきたい制約とセキュリティ上の注意

こんな方に向けた記事です

  • 国産基盤のLLMを社内やオンプレミスで動かしたいエンジニア・情報システム担当者
  • LLM-jp-4.1とELYZA版のどちらを使うか迷っている開発者・研究者
  • 国産LLMの最新動向を追っているAI導入担当者

ELYZA-Thinking-1.0(llm-jp-4版)とは

ELYZA公式サイトのロゴ画像

出典:ELYZA公式サイト

ELYZA-Thinking-1.0(llm-jp-4版)は、「答える前に考える」タイプの推論モデルです。開発はELYZAですが、土台の事前学習はNIIのLLM-jpプロジェクトが行っています。ELYZAはそのベースモデルに、中間学習・教師ありファインチューニング(SFT)・強化学習を加えて、日本語の推論と指示追従を強化しました。

ベースになっているLLM-jp-4そのものについては、LLM-jp-4とは?国立情報学研究所・約12兆トークン学習の国産LLMを徹底解説で詳しくまとめています。

基本スペック

項目

ELYZA-Thinking-1.0-llm-jp-4-33b

ELYZA-Thinking-1.0-llm-jp-4-32b-a3b

開発元

株式会社ELYZA(KDDIグループ)

同左

公開日

2026年10月2日

2026年10月2日

ベースモデル

llm-jp-4-33b-base(NII)

llm-jp-4-32b-a3b-base(NII)

構造

Dense(全パラメータを毎回使用)

MoE(128エキスパート中8つを使用)

総パラメータ

約332億

約321億(アクティブ約30億)

最大コンテキスト

65,536トークン(約64K)

65,536トークン(約64K)

対応言語

日本語・英語

日本語・英語

入力

テキストのみ

テキストのみ

機能

推論(常時思考)+ツール呼び出し

同左

ライセンス

Apache 2.0(商用利用可)

Apache 2.0(商用利用可)

提供形態

Hugging Faceでの重み公開のみ

同左

出典: Hugging Face 公式モデルカード(33B)、同(32B-A3B)

現時点では、ELYZAによる公式API・公式チャット画面の提供は確認できません。ChatGPTのようにブラウザで試すことはできず、自分でGPU環境を用意して動かすモデルです。

2025年版「ELYZA-Thinking-1.0-Qwen-32B」とは別物

「ELYZA-Thinking-1.0」で検索すると、2025年5月に公開された同名のモデルの情報が多く表示されます。名前はほぼ同じですが、中身はまったく違います。

項目

ELYZA-Thinking-1.0-Qwen-32B(2025年版)

ELYZA-Thinking-1.0-llm-jp-4(2026年版)

公開日

2025年5月1日

2026年10月2日

ベースの重み

Qwen2.5-32B-Instruct(Alibaba)

LLM-jp-4(NIIが国内でゼロから学習)

主な学習手法

探索で生成した推論データによる模倣学習

中間学習+SFT+強化学習(RLVR)

出力形式

<think>タグ形式

harmony形式(思考と回答を別チャネルで出力)

コンテキスト長

32K

64K

サイズ

32Bのみ

33B(Dense)/32B-A3B(MoE)

2025年版の「o1-mini並み」といった評価は、2026年版には当てはまりません。記事やSNSで性能の話を見かけたら、どちらのモデルの話かを確認してください。

「完全国産基盤」はどこまでが国産なのか

国産と言えるのは、土台(ベースモデル)の事前学習です。モデルカードの原文は "Fully domestic foundation" で、「LLM-jp-4は日本国内でゼロから事前学習され、その後の学習はすべてELYZAが実施した」と説明されています。

一方で、次の点は「国産」の範囲外、または公表されていません。

要素

状況

事前学習(重みの土台)

NIIが国内でゼロから学習。国産と言える

追加学習(中間学習・SFT・強化学習)

ELYZAが実施。国内企業による学習

ネットワーク構造(設計図)

33BはLlama系、32B-A3BはQwen3 MoE系の構造を採用

SFTで使った教師モデル

名称非公開

構造がLlama系・Qwen3 MoE系というのは、設計図の形式を借りているという意味です。MetaやAlibabaの学習済みの重みを使っているわけではありません。海外モデルの重みをベースにした2025年版や、DeepSeek V3ベースで議論になった楽天のRakuten AI 3.0とは、ここが根本的に違います。

なお、ITmedia AI+は公開当日に「『完全国産』AI」という見出しで報じましたが、ELYZAから「『完全国産』という日本語訳のニュアンスが想定と異なった」との説明があり、見出しと本文が修正されています。正確に言うと「国内でゼロから事前学習された国産基盤LLM-jp-4をベースにした推論モデル」です。

出典: ITmedia AI+

ほかの国産LLMの「国産」の度合いと比べたい方は、国産LLM 7選 徹底比較が参考になります。

33B(Dense)と32B-A3B(MoE)の違い・選び方

Hugging FaceのELYZA-Thinking-1.0-llm-jp-4-32b-a3bモデルページ

出典:Hugging Face(elyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b)

迷ったら、精度を優先するなら33B、応答速度と処理コストを優先するなら32B-A3Bを選んでください。必要なGPUメモリはどちらもほぼ同じです。

比較項目

33B(Dense)

32B-A3B(MoE)

総合平均(ELYZA公表値)

61.69

58.46

推論時に動くパラメータ

約332億(全部)

約30億(一部のみ)

応答速度

遅め

速い(アクティブ3B相当)

必要GPUメモリ(BF16・推定)

約66GB+KVキャッシュ

約64GB+KVキャッシュ

量子化版

確認できず

コミュニティ製MLX 4bit(Apple Silicon向け)あり

こんな用途におすすめ

回答品質が重要な社内QA・文書作成・研究

同時アクセスの多い社内チャット・エージェントの試作

※必要GPUメモリはパラメータ数×2バイトからの推定値です。ELYZAは公式な必要スペックを公表していません。

MoEは「メモリは全パラメータ分必要、計算は一部だけ」という仕組みです。32B-A3Bを選んでもGPUメモリは減りませんが、1トークンあたりの計算量が小さくなるため、生成が速く、同じGPUでさばけるリクエスト数が増えます。

現実的には、BF16のまま動かすならH100やA100の80GBクラスが1枚以上必要です。LLM-jp-4 33Bの公式GGUF(Q4_K_M)は約20GBなので、ELYZA版も4bit量子化すれば24GB級のGPUに収まる可能性があります。ただし、ELYZA公式の量子化版は現時点で出ていません。

性能比較:LLM-jp-4.1とどちらが上か

LLM-jp(国立情報学研究所)公式サイトのロゴ画像

出典:LLM-jp公式サイト(国立情報学研究所)

33Bは「総合でわずかに上、ただし数学とツール呼び出しはLLM-jp-4.1が上」、32B-A3Bは「ほぼ全面的にELYZA版が上」です。数値はすべてELYZAが自社で評価したもので、第三者による再現は現時点で確認できていません。

総合平均の比較

モデル

全体平均

日本語平均

英語平均

ELYZA-Thinking-1.0 33B

61.69

62.18

59.72

LLM-jp-4.1-33b-thinking

60.64

61.78

59.11

LLM-jp-4-33b-thinking

51.50

53.04

48.25

ELYZA-Thinking-1.0 32B-A3B

58.46

59.61

55.94

LLM-jp-4.1-32b-a3b-thinking

53.89

56.65

49.72

LLM-jp-4-32b-a3b-thinking

46.38

49.16

41.16

出典: ELYZA公式モデルカード(20ベンチマークを7つの能力グループで平均したうえで、グループ間を平均した値)

元のLLM-jp-4に比べると、33Bで約10ポイント、32B-A3Bで約12ポイントの改善です。LLM-jp-4.1との差は、33Bが約1ポイント、32B-A3Bが約4.6ポイントでした。

33Bの項目別比較(vs LLM-jp-4.1)

能力

ベンチマーク

ELYZA 33B

LLM-jp-4.1 33B

勝ち

日本語知識QA

JamC-QA

66.35

57.69

ELYZA

日本語知識QA

JEMHopQA

73.85

65.84

ELYZA

指示追従

M-IFEval-ja

85.84

80.53

ELYZA

指示追従

JFBench

39.02

32.79

ELYZA

指示追従

IFEval(英語)

95.32

93.59

ELYZA

コーディング

LiveCodeBench v6

60.23

45.20

ELYZA

知識・科学

JMMLU

84.69

85.49

4.1

知識・科学

GPQA(日本語)

60.97

64.19

4.1

数学

AIME 2024+2025

68.85

78.23

4.1

数学

PolyMath(日本語)

35.90

44.20

4.1

ツール呼び出し

BFCL v4

38.73

48.14

4.1

ツール呼び出し

Nejumi BFCL(日本語)

46.53

51.16

4.1

33Bは得意分野がきれいに分かれています。日本の知識を問う質問、「ふりがなを付ける」「漢数字で書く」といった細かい日本語の指示、コード生成はELYZA版が強く、難しい数学や科学知識、ツール呼び出しはLLM-jp-4.1が強い結果です。

32B-A3Bの項目別比較(vs LLM-jp-4.1)

能力

ベンチマーク

ELYZA 32B-A3B

LLM-jp-4.1 32B-A3B

勝ち

日本語知識QA

JEMHopQA

71.59

65.51

ELYZA

指示追従

JFBench

38.15

30.87

ELYZA

数学

AIME 2024+2025

62.29

57.71

ELYZA

数学

PolyMath(日本語)

34.60

27.40

ELYZA

コーディング

LiveCodeBench v6

53.66

32.40

ELYZA

ツール呼び出し

Nejumi BFCL(日本語)

41.89

39.19

ELYZA

知識・科学

JMMLU

81.05

83.09

4.1

知識・科学

MMLU-Pro

73.14

73.90

4.1

MoE版では、LLM-jp-4.1が上回ったのはJMMLUとMMLU-Proの2項目だけでした。32B-A3Bクラスで国産基盤のモデルを選ぶなら、現時点ではELYZA版が有力です。

開発アプローチと使い勝手の違い

比較項目

ELYZA-Thinking-1.0(llm-jp-4版)

LLM-jp-4.1

開発元

ELYZA

NII(LLM-jp)

公開日

2026年10月2日

2026年9月28日

追加学習の方法

中間学習+SFT+強化学習(RLVR)

SFT+DPO(事後学習を改善)

サイズ

33B/32B-A3B

8B/32B-A3B/33B

思考の強さ(effort)切替

なし(常に思考)

あり

並列ツール呼び出し

非対応

対応

公式GGUF

なし

あり

ブラウザ・APIで試す手段

なし

東京大学のmdx-MaaSで試験提供予定(10月中旬から募集)

ライセンス

Apache 2.0

Apache 2.0

性能はELYZA版が上回る項目が多い一方、手軽さはLLM-jp-4.1が上です。8Bモデルがあり、公式GGUFでローカルPCでも動かしやすく、mdx-MaaSでGPUなしに試せる見込みもあります。LLM-jp-4 33B系のGGUFや必要VRAMはLLM-jp-4 33Bとは?で詳しく解説しています。

Qwen3.5・Gemma 4など海外モデルとの比較

総合力では、海外の最新オープンモデルに及びません。ELYZA自身の公表値でも、同クラスのQwen3.5やGemma 4に総合平均で約6〜10ポイントの差をつけられています。

モデル

構造

全体平均

日本語平均

JEMHopQA

JFBench

Gemma 4 31B

Dense

70.54

68.88

63.91

35.68

Qwen3.5-27B

Dense

68.18

66.05

62.87

34.12

ELYZA-Thinking-1.0 33B

Dense

61.69

62.18

73.85

39.02

Qwen3-32B

Dense

58.11

58.97

58.62

21.42

Gemma 4 26B-A4B

MoE

68.58

66.68

61.93

30.30

Qwen3.5-35B-A3B

MoE

66.37

64.24

58.88

28.83

ELYZA-Thinking-1.0 32B-A3B

MoE

58.46

59.61

71.59

38.15

gpt-oss-20b

MoE

57.26

55.04

54.16

18.38

出典: ELYZA公式モデルカード

それでも、JEMHopQA(日本語の複数段階の知識QA)とJFBench(日本語の複雑な指示追従)では、比較対象のどのモデルよりも高いスコアです。数学(AIME)、コーディング(LiveCodeBench)、ツール呼び出し(BFCL)では海外モデルとの差が大きく、AIMEではGemma 4 31Bの88.75に対してELYZA 33Bは68.85でした。

「総合力が欲しい」ならGemma 4やQwen系、「国産基盤であること」と「日本語の知識・指示追従」を重視するならELYZA-Thinking、という選び方になります。海外モデルの詳細はGemma 4使い方・性能比較・モデルサイズ完全解説やQwen3.8-27Bとは?を参照してください。

学習方法と「AIによるAI開発」(ELYZA RSI Research)

ELYZA-Thinking-1.0の特徴は、性能だけでなく作り方にもあります。ELYZAによると、中間学習から事後学習・評価までの一連の工程を、AIエージェント中心で回しました。人間が手を動かした作業は1〜2人日程度だったと説明しています。

3段階の学習

段階

内容

中間学習

数学・コード・STEMの問題を日本語に翻訳し、推論過程を新たに生成(英語の元データも残す)。エージェント用データも日本語化(ツール名・引数・JSONはそのまま)

SFT

思考過程つきの合成データ数百万件(約半分が日本語)。教師モデルの回答のうち、数式の等価判定・ユニットテスト・ルールチェッカーで正しさを確認できたものだけを採用

強化学習(RLVR)

数学・コード・日本語知識・複雑な指示追従・ツール利用をまとめて1回で学習。報酬はプログラムで自動計算。「解けたり解けなかったりする」難易度の問題を選び、解かずに点を取れる抜け道を事前に塞いだ

日本語の知識は、最新の日本語WikipediaとWikidataから合成したデータで学習しています。JamC-QAやJEMHopQAのスコアが高いのは、この工程の効果と考えられます。

ELYZA RSI Researchとの関係

モデル公開と同じ10月2日、ELYZAは「再帰的自己改善(RSI)」を研究する組織「ELYZA RSI Research」を立ち上げました。RSIは、AIが自分自身の開発・改善を担っていく考え方です。ELYZA-Thinking-1.0は、この研究の成果の1つとして公開されました。

同時に、カスタマーセンター業務のエージェントを評価するベンチマーク「ELYZA Agent Tasks: Customer Service」や、自律改善エージェントの実験結果も発表されています。ビジネス+ITの報道では、未知のテストデータでのタスク完遂率が34.3%から52.9%に上がり、推論コストを67%削減したとされています。

ただし、ELYZA自身は「RSIが実現したわけではなく、RSIに向けた要素技術の研究」と位置付けています。「AIが自分でAIを作った」という段階ではない点は押さえておきましょう。ELYZAの最近の動きはELYZAのAIアプリ生成特許が炎上でも取り上げています。

出典: ELYZA 公式ニュースリリース、ビジネス+IT

料金・ライセンス

Hugging FaceのELYZA-Thinking-1.0-llm-jp-4-33bモデルページ

出典:Hugging Face(elyza/ELYZA-Thinking-1.0-llm-jp-4-33b)

モデル自体は無料です。Hugging Faceからダウンロードでき、ライセンス料も利用料もかかりません。実際にかかるのはGPUのコストです。

項目

内容

モデル利用料

無料

ライセンス

Apache 2.0

商用利用

可

改変・再配布

可(LICENSEの同梱、NOTICEの保持、改変箇所の明示が必要)

ELYZA公式API

確認できず

実質コスト

GPUサーバー(80GB級GPU×1枚以上が目安)の購入・レンタル費用

NOTICEファイルには、本モデルがllm-jp-4ベースモデルの派生物であることが記載されています。社内で改変したモデルを配布・提供する場合は、このNOTICEを残してください。

クラウドGPUを借りる場合はH100/A100 80GBクラスのインスタンスが選択肢になります。料金は事業者やリージョンで大きく変わるため、事前に見積もりを取りましょう。GPUを用意せずに日本語特化LLMを使いたい場合は、Sakana Namazuとは?のようなAPI提供型のサービスも比較対象になります。

使い方(vLLM/Transformers/ツール呼び出し)

vLLMのGitHubリポジトリ(推論エンジン)

出典:GitHub(vllm-project/vllm)

公式が推奨しているのはvLLMでの運用です。OpenAI互換のAPIサーバーとして立ち上げれば、既存のOpenAI SDKやアプリからそのまま呼び出せます。

vLLMで起動する(推奨)

公式モデルカードでは、vLLM 0.30.0で動作を検証しています。リポジトリに含まれる専用プラグイン(思考の分離とツール呼び出しの解析用)をダウンロードしてから起動します。

pip install vllm==0.30.0
pip install flashinfer-jit-cache==0.6.18.post1 --extra-index-url https://flashinfer.ai/whl/cu130

# 専用プラグインを取得
hf download elyza/ELYZA-Thinking-1.0-llm-jp-4-33b --include "vllm_plugins/*" --local-dir .

# サーバー起動
vllm serve elyza/ELYZA-Thinking-1.0-llm-jp-4-33b \
  --max-model-len 65536 --trust-remote-code \
  --reasoning-parser-plugin vllm_plugins/multi_parser_loader.py --reasoning-parser llmjp4 \
  --tool-parser-plugin vllm_plugins/llmjp_harmony_tool_parser.py --tool-call-parser llmjp_harmony \
  --enable-auto-tool-choice

32B-A3Bを使う場合は、モデル名を elyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b に変え、--moe-backend triton を追加します。

起動後は http://localhost:8000/v1/chat/completions にOpenAI形式でリクエストを送ります。

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

res = client.chat.completions.create(
    model="elyza/ELYZA-Thinking-1.0-llm-jp-4-33b",
    messages=[{"role": "user", "content": "日本の三大祭りを、ふりがな付きで説明してください。"}],
    temperature=0.6,
    top_p=0.95,
)
print(res.choices[0].message.content)

回答本文は content に入り、思考過程は別のフィールドで返ります。アプリ側で思考過程を表示するかどうかを選べます。

ツール呼び出し

ツールはOpenAI標準の tools フィールドで定義します。vLLMのツールパーサーを有効にしておけば、追加の設定なしで tool_calls として結果が返ります。

tools = [{
    "type": "function",
    "function": {
        "name": "get_weather",
        "description": "指定した都市の天気を取得する",
        "parameters": {
            "type": "object",
            "properties": {"city": {"type": "string"}},
            "required": ["city"],
        },
    },
}]

res = client.chat.completions.create(
    model="elyza/ELYZA-Thinking-1.0-llm-jp-4-33b",
    messages=[{"role": "user", "content": "札幌の天気を教えて"}],
    tools=tools,
)
print(res.choices[0].message.tool_calls)

複数のツールを同時に呼ぶ「並列ツール呼び出し」には対応していません。複数ツールを使うエージェントでは、1回ずつ順番に呼び出す設計にしてください。

Transformersで動かす

検証用にPythonから直接動かすなら、Transformers(4.57.6/5.18.0で検証済み)も使えます。

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "elyza/ELYZA-Thinking-1.0-llm-jp-4-33b"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id, dtype=torch.bfloat16, device_map="auto", trust_remote_code=True
)

messages = [{"role": "user", "content": "敬語の種類を3つ挙げて説明してください。"}]
inputs = tokenizer.apply_chat_template(
    messages, add_generation_prompt=True, return_tensors="pt"
).to(model.device)

outputs = model.generate(
    inputs, max_new_tokens=16384, do_sample=True, temperature=0.6, top_p=0.95
)
print(tokenizer.decode(outputs[0][inputs.shape[-1]:]))

出力はharmony形式で、思考と回答が混ざった状態で返ります。モデルカードでは、リポジトリ内の parse_harmony_message() で思考チャネルと回答を分ける方法が案内されています。

推奨設定のまとめ

設定

推奨値

temperature

0.6

top_p

0.95

max_new_tokens

16,384程度(思考の分を見込む)

最大出力の目安

コンテキスト長−4,096トークン

思考のオン/オフ

切替なし(常にオン)

Mac・Ollamaで動くか

Apple Silicon向けには、コミュニティ製の32B-A3B MLX 4bit量子化版(rariruluis/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b-mlx-4bit)が公開されています。ELYZA公式ではないため、動作や品質は自分で確認してください。

OllamaやLM Studioでの公式サポートは、現時点で確認できていません。元のLLM-jp-4系は独自トークナイザの関係で、llama.cpp本家ではなくLLM-jp版のforkが必要とされており、ELYZA版でも同じ注意が必要になる可能性があります。Ollamaの基本はOllamaとは?使い方・対応モデル・必要スペックで解説しています。

出典: Hugging Face 公式モデルカード(33B)

できないこと・注意点(セキュリティ含む)

導入前に必ず確認しておきたいのは、「GPUなしでは試せない」「常に思考するのでコストがかさむ」「trust_remote_code が必須」の3点です。

機能面の制約

制約

内容

影響

テキストのみ

画像・音声の入力は不可

図表や帳票の読み取りには使えない

コンテキスト64K

長い資料をまとめて入れにくい

256KのPLaMo 3.0 Primeなどより短い

常に思考する

effort切替なし

短い質問でもトークン消費と待ち時間が増える

並列ツール呼び出し非対応

harmony形式の制約

エージェント設計に工夫が必要

小型モデルなし

8B等はない

ノートPCでは動かしにくい

公式量子化版なし

GGUF等は未公開

一般的なGPUでの運用は現時点で難しい

安全性評価の記載なし

モデルカードにガードレールの説明なし

有害出力対策は利用者側で用意する

長文を扱いたい場合は、PLaMo 3.0 Primeとは?も比較してみてください。

セキュリティ面の注意

  • trust_remote_code=True の扱い: リポジトリ内のPythonコード(独自トークナイザやharmonyパーサー)が手元で実行されます。企業で導入する場合は、コードをレビューしたうえで、revision= でコミットを固定して使うのが安全です
  • 推論サーバーの公開設定: vLLMはそのままだと認証なしでAPIを受け付けます。ポートを外部に開けない、APIキーやリバースプロキシで保護するなどの対策が必要です
  • 思考過程のログ: 思考過程にも入力した機密情報が含まれることがあります。ログ保存やユーザーへの表示をどうするか、事前に決めておきましょう
  • ツール連携の権限: 社内システムとつなぐ場合、モデルに渡す権限は最小限にしてください
  • 教師モデルの扱い: SFTに使われた教師モデルの名称は公開されていません。厳しいコンプライアンス要件がある場合は、この点も確認対象になります

一方で、重みを手元に置いて動かせるため、入力データを外部のAPIに送らずに済みます。機密情報や個人情報を扱う業務では、この点が大きなメリットです。

こんな人におすすめ/おすすめしない人

ELYZA-Thinking-1.0は、国産基盤のモデルを自社のGPU環境で動かしたい組織向けです。手軽に試したい個人や、総合性能を最優先したい人には向きません。

こんな人におすすめ

  • 社内規定や取引先の要件で「国産基盤のLLM」を求められている企業
  • 機密データ・個人情報をオンプレミスやプライベート環境だけで処理したい組織
  • 日本の制度・地名・文化などの知識QAや、細かい日本語の書式指定が重要な業務を持つ人
  • 80GB級のGPUを用意でき、vLLMの構築に慣れている開発者・研究者
  • 国産LLMをベースに、自社データで追加学習したい研究チーム(Apache 2.0で改変可)

おすすめしない人

  • GPUを持っておらず、まずブラウザで試したい人 → ChatGPTやClaudeなどのSaaS、またはLLM-jp-4.1のmdx-MaaS(試験提供予定)
  • 総合性能・数学・コーディングを最優先したい人 → Gemma 4やQwen3.5系
  • 画像入力や64Kを超える長文処理が必要な人 → マルチモーダル対応モデルやPLaMo 3.0 Prime
  • ノートPCやゲーミングPCで手軽に動かしたい人 → LLM-jp-4.1-8bやGemma 4 12B
  • プログラミングをせずに使いたい人

目的別の選び方

やりたいこと

おすすめのモデル

国産基盤で日本語の知識QA・指示追従を重視

ELYZA-Thinking-1.0 33B

国産基盤で応答速度と同時処理数を重視

ELYZA-Thinking-1.0 32B-A3B

国産基盤で数学・ツール呼び出しを重視

LLM-jp-4.1-33b-thinking

国産基盤を小さいGPUで動かしたい

LLM-jp-4.1-8b-thinking(公式GGUFあり)

GPUなしで国産モデルを試したい

LLM-jp-4.1(mdx-MaaS、試験提供予定)

国産にこだわらず総合性能を重視

Gemma 4 31B/Qwen3.5-27B

長文(256K)を扱いたい

PLaMo 3.0 Prime

NTTの国産LLMも候補に入れたい方は、NTT tsuzumi 2とは?もあわせてご覧ください。

よくある質問

Q. ChatGPTのように会話画面で使えますか?

現時点ではELYZA公式のチャット画面はありません。vLLMでサーバーを立てたうえで、Open WebUIなどOpenAI互換APIに対応したチャットUIを接続すれば、社内向けにChatGPTに近い画面を作れます。

Q. 商用サービスに組み込む場合の条件は?

Apache 2.0なので、利用料なしで商用サービスに組み込めます。条件は、LICENSEの同梱、NOTICE(llm-jp-4ベースモデルの派生物である旨)の保持、改変した場合の明示です。出力した文章の権利や、出力内容に対する責任は利用者側で管理する必要があります。

Q. LLM-jp-4.1をファインチューニングしたモデルですか?

違います。ELYZA-Thinking-1.0は、LLM-jp-4のベースモデル(事前学習のみの状態)にELYZAが独自に追加学習したモデルです。LLM-jp-4.1はNIIが同じベースモデルから作った別系統の推論モデルで、両者は兄弟のような関係です。

Q. 英語でも使えますか?

対応言語は日本語と英語です。英語平均は33Bで59.72と、LLM-jp-4.1(59.11)とほぼ同じ水準です。英語中心の用途なら、Gemma 4やQwen3.5系のほうがスコアは高くなっています。

Q. 公開されたベンチマークの数値は信頼できますか?

数値はすべてELYZA自身による評価です。評価条件(temperatureやreasoning effortの設定、並列ツール呼び出しの除外など)はモデルカードに公開されていますが、第三者による再現は現時点で確認できていません。導入時は、自社の業務データで小規模に検証することをおすすめします。

Q. 今後、小型版やAPI提供は出ますか?

現時点でELYZAからの発表はありません。NII側は次期LLM-jp-4.2で強化学習による推論・エージェント能力の強化を予定しており、国産基盤モデルの選択肢は今後も増えていく見込みです。

まとめ

ELYZA-Thinking-1.0(llm-jp-4版)は、NIIが国内でゼロから事前学習したLLM-jp-4を土台に、ELYZAが強化学習まで行った日本語推論モデルです。

  • 33B(Dense)と32B-A3B(MoE)の2モデル。Apache 2.0で無料、商用利用可
  • ELYZA公表値ではLLM-jp-4.1を総合平均で上回った(33Bは+約1ポイント、32B-A3Bは+約4.6ポイント)
  • 日本語の知識QAと指示追従が強み。33Bの数学とツール呼び出しはLLM-jp-4.1が上
  • 総合平均は同クラスのQwen3.5・Gemma 4に約6〜10ポイント及ばない
  • 公式API・公式量子化版はなく、80GB級GPUとvLLMの構築が前提
  • 「完全国産」なのは土台の事前学習まで。構造はLlama系・Qwen3 MoE系で、SFTの教師モデルは非公開

国産基盤であることと日本語の精度を重視し、自社GPUで運用できる組織にとっては有力な選択肢です。手軽さを重視するならLLM-jp-4.1、総合性能を重視するなら海外オープンモデルと比べたうえで決めてください。国産LLM全体の位置づけは国産LLM 7選 徹底比較で確認できます。

このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します

業務を1つ送る

この記事の著者

AI革命

AI革命

編集部

AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。

経理・事務作業・開発を、AI革命にまとめて任せられます

ご相談は無料です。オンラインで完結します