ELYZA-Thinking-1.0とは?LLM-jp-4ベースの国産推論モデル・33B/32B-A3Bの性能・使い方・LLM-jp-4.1比較【2026年10月】

この記事のポイント
ELYZA-Thinking-1.0(llm-jp-4版)は、国内でゼロから事前学習されたLLM-jp-4をベースにELYZAが開発した日本語推論モデルです。33B/32B-A3Bの違い、LLM-jp-4.1との項目別比較、vLLMでの使い方、必要GPU、導入時の注意点を公式情報をもとにまとめました。
ELYZA-Thinking-1.0(llm-jp-4版)は、KDDIグループのELYZAが2026年10月2日に公開した日本語特化の推論モデルです。国立情報学研究所(NII)が国内でゼロから事前学習した国産オープンLLM「LLM-jp-4」をベースにしており、33B(Dense)と32B-A3B(MoE)の2モデルがApache 2.0で無料公開されています。
ELYZAの公表値では、同サイズのLLM-jp-4.1を総合平均で上回りました。特に日本語の知識QAと細かい指示への追従で高いスコアを出しています。ただし33Bは数学とツール呼び出しで4.1に負けており、Qwen3.5やGemma 4といった海外の最新オープンモデルには総合平均で約6〜10ポイント届きません。得意・不得意がはっきりしたモデルです。
この記事でわかること
- ELYZA-Thinking-1.0(llm-jp-4版)の基本スペックと、2025年版(Qwenベース)との違い
- 「完全国産基盤」という表現が指している範囲
- 33Bと32B-A3Bの違いと選び方
- LLM-jp-4.1・Qwen3.5・Gemma 4との項目別の性能比較
- vLLM/Transformersでの使い方、必要なGPUの目安
- 導入前に押さえておきたい制約とセキュリティ上の注意
こんな方に向けた記事です
- 国産基盤のLLMを社内やオンプレミスで動かしたいエンジニア・情報システム担当者
- LLM-jp-4.1とELYZA版のどちらを使うか迷っている開発者・研究者
- 国産LLMの最新動向を追っているAI導入担当者
ELYZA-Thinking-1.0(llm-jp-4版)とは

出典:ELYZA公式サイト
ELYZA-Thinking-1.0(llm-jp-4版)は、「答える前に考える」タイプの推論モデルです。開発はELYZAですが、土台の事前学習はNIIのLLM-jpプロジェクトが行っています。ELYZAはそのベースモデルに、中間学習・教師ありファインチューニング(SFT)・強化学習を加えて、日本語の推論と指示追従を強化しました。
ベースになっているLLM-jp-4そのものについては、LLM-jp-4とは?国立情報学研究所・約12兆トークン学習の国産LLMを徹底解説で詳しくまとめています。
基本スペック
項目 | ELYZA-Thinking-1.0-llm-jp-4-33b | ELYZA-Thinking-1.0-llm-jp-4-32b-a3b |
|---|---|---|
開発元 | 株式会社ELYZA(KDDIグループ) | 同左 |
公開日 | 2026年10月2日 | 2026年10月2日 |
ベースモデル | llm-jp-4-33b-base(NII) | llm-jp-4-32b-a3b-base(NII) |
構造 | Dense(全パラメータを毎回使用) | MoE(128エキスパート中8つを使用) |
総パラメータ | 約332億 | 約321億(アクティブ約30億) |
最大コンテキスト | 65,536トークン(約64K) | 65,536トークン(約64K) |
対応言語 | 日本語・英語 | 日本語・英語 |
入力 | テキストのみ | テキストのみ |
機能 | 推論(常時思考)+ツール呼び出し | 同左 |
ライセンス | Apache 2.0(商用利用可) | Apache 2.0(商用利用可) |
提供形態 | Hugging Faceでの重み公開のみ | 同左 |
出典: Hugging Face 公式モデルカード(33B)、同(32B-A3B)
現時点では、ELYZAによる公式API・公式チャット画面の提供は確認できません。ChatGPTのようにブラウザで試すことはできず、自分でGPU環境を用意して動かすモデルです。
2025年版「ELYZA-Thinking-1.0-Qwen-32B」とは別物
「ELYZA-Thinking-1.0」で検索すると、2025年5月に公開された同名のモデルの情報が多く表示されます。名前はほぼ同じですが、中身はまったく違います。
項目 | ELYZA-Thinking-1.0-Qwen-32B(2025年版) | ELYZA-Thinking-1.0-llm-jp-4(2026年版) |
|---|---|---|
公開日 | 2025年5月1日 | 2026年10月2日 |
ベースの重み | Qwen2.5-32B-Instruct(Alibaba) | LLM-jp-4(NIIが国内でゼロから学習) |
主な学習手法 | 探索で生成した推論データによる模倣学習 | 中間学習+SFT+強化学習(RLVR) |
出力形式 |
| harmony形式(思考と回答を別チャネルで出力) |
コンテキスト長 | 32K | 64K |
サイズ | 32Bのみ | 33B(Dense)/32B-A3B(MoE) |
2025年版の「o1-mini並み」といった評価は、2026年版には当てはまりません。記事やSNSで性能の話を見かけたら、どちらのモデルの話かを確認してください。
「完全国産基盤」はどこまでが国産なのか
国産と言えるのは、土台(ベースモデル)の事前学習です。モデルカードの原文は "Fully domestic foundation" で、「LLM-jp-4は日本国内でゼロから事前学習され、その後の学習はすべてELYZAが実施した」と説明されています。
一方で、次の点は「国産」の範囲外、または公表されていません。
要素 | 状況 |
|---|---|
事前学習(重みの土台) | NIIが国内でゼロから学習。国産と言える |
追加学習(中間学習・SFT・強化学習) | ELYZAが実施。国内企業による学習 |
ネットワーク構造(設計図) | 33BはLlama系、32B-A3BはQwen3 MoE系の構造を採用 |
SFTで使った教師モデル | 名称非公開 |
構造がLlama系・Qwen3 MoE系というのは、設計図の形式を借りているという意味です。MetaやAlibabaの学習済みの重みを使っているわけではありません。海外モデルの重みをベースにした2025年版や、DeepSeek V3ベースで議論になった楽天のRakuten AI 3.0とは、ここが根本的に違います。
なお、ITmedia AI+は公開当日に「『完全国産』AI」という見出しで報じましたが、ELYZAから「『完全国産』という日本語訳のニュアンスが想定と異なった」との説明があり、見出しと本文が修正されています。正確に言うと「国内でゼロから事前学習された国産基盤LLM-jp-4をベースにした推論モデル」です。
出典: ITmedia AI+
ほかの国産LLMの「国産」の度合いと比べたい方は、国産LLM 7選 徹底比較が参考になります。
33B(Dense)と32B-A3B(MoE)の違い・選び方

出典:Hugging Face(elyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b)
迷ったら、精度を優先するなら33B、応答速度と処理コストを優先するなら32B-A3Bを選んでください。必要なGPUメモリはどちらもほぼ同じです。
比較項目 | 33B(Dense) | 32B-A3B(MoE) |
|---|---|---|
総合平均(ELYZA公表値) | 61.69 | 58.46 |
推論時に動くパラメータ | 約332億(全部) | 約30億(一部のみ) |
応答速度 | 遅め | 速い(アクティブ3B相当) |
必要GPUメモリ(BF16・推定) | 約66GB+KVキャッシュ | 約64GB+KVキャッシュ |
量子化版 | 確認できず | コミュニティ製MLX 4bit(Apple Silicon向け)あり |
こんな用途におすすめ | 回答品質が重要な社内QA・文書作成・研究 | 同時アクセスの多い社内チャット・エージェントの試作 |
※必要GPUメモリはパラメータ数×2バイトからの推定値です。ELYZAは公式な必要スペックを公表していません。
MoEは「メモリは全パラメータ分必要、計算は一部だけ」という仕組みです。32B-A3Bを選んでもGPUメモリは減りませんが、1トークンあたりの計算量が小さくなるため、生成が速く、同じGPUでさばけるリクエスト数が増えます。
現実的には、BF16のまま動かすならH100やA100の80GBクラスが1枚以上必要です。LLM-jp-4 33Bの公式GGUF(Q4_K_M)は約20GBなので、ELYZA版も4bit量子化すれば24GB級のGPUに収まる可能性があります。ただし、ELYZA公式の量子化版は現時点で出ていません。
性能比較:LLM-jp-4.1とどちらが上か

33Bは「総合でわずかに上、ただし数学とツール呼び出しはLLM-jp-4.1が上」、32B-A3Bは「ほぼ全面的にELYZA版が上」です。数値はすべてELYZAが自社で評価したもので、第三者による再現は現時点で確認できていません。
総合平均の比較
モデル | 全体平均 | 日本語平均 | 英語平均 |
|---|---|---|---|
ELYZA-Thinking-1.0 33B | 61.69 | 62.18 | 59.72 |
LLM-jp-4.1-33b-thinking | 60.64 | 61.78 | 59.11 |
LLM-jp-4-33b-thinking | 51.50 | 53.04 | 48.25 |
ELYZA-Thinking-1.0 32B-A3B | 58.46 | 59.61 | 55.94 |
LLM-jp-4.1-32b-a3b-thinking | 53.89 | 56.65 | 49.72 |
LLM-jp-4-32b-a3b-thinking | 46.38 | 49.16 | 41.16 |
出典: ELYZA公式モデルカード(20ベンチマークを7つの能力グループで平均したうえで、グループ間を平均した値)
元のLLM-jp-4に比べると、33Bで約10ポイント、32B-A3Bで約12ポイントの改善です。LLM-jp-4.1との差は、33Bが約1ポイント、32B-A3Bが約4.6ポイントでした。
33Bの項目別比較(vs LLM-jp-4.1)
能力 | ベンチマーク | ELYZA 33B | LLM-jp-4.1 33B | 勝ち |
|---|---|---|---|---|
日本語知識QA | JamC-QA | 66.35 | 57.69 | ELYZA |
日本語知識QA | JEMHopQA | 73.85 | 65.84 | ELYZA |
指示追従 | M-IFEval-ja | 85.84 | 80.53 | ELYZA |
指示追従 | JFBench | 39.02 | 32.79 | ELYZA |
指示追従 | IFEval(英語) | 95.32 | 93.59 | ELYZA |
コーディング | LiveCodeBench v6 | 60.23 | 45.20 | ELYZA |
知識・科学 | JMMLU | 84.69 | 85.49 | 4.1 |
知識・科学 | GPQA(日本語) | 60.97 | 64.19 | 4.1 |
数学 | AIME 2024+2025 | 68.85 | 78.23 | 4.1 |
数学 | PolyMath(日本語) | 35.90 | 44.20 | 4.1 |
ツール呼び出し | BFCL v4 | 38.73 | 48.14 | 4.1 |
ツール呼び出し | Nejumi BFCL(日本語) | 46.53 | 51.16 | 4.1 |
33Bは得意分野がきれいに分かれています。日本の知識を問う質問、「ふりがなを付ける」「漢数字で書く」といった細かい日本語の指示、コード生成はELYZA版が強く、難しい数学や科学知識、ツール呼び出しはLLM-jp-4.1が強い結果です。
32B-A3Bの項目別比較(vs LLM-jp-4.1)
能力 | ベンチマーク | ELYZA 32B-A3B | LLM-jp-4.1 32B-A3B | 勝ち |
|---|---|---|---|---|
日本語知識QA | JEMHopQA | 71.59 | 65.51 | ELYZA |
指示追従 | JFBench | 38.15 | 30.87 | ELYZA |
数学 | AIME 2024+2025 | 62.29 | 57.71 | ELYZA |
数学 | PolyMath(日本語) | 34.60 | 27.40 | ELYZA |
コーディング | LiveCodeBench v6 | 53.66 | 32.40 | ELYZA |
ツール呼び出し | Nejumi BFCL(日本語) | 41.89 | 39.19 | ELYZA |
知識・科学 | JMMLU | 81.05 | 83.09 | 4.1 |
知識・科学 | MMLU-Pro | 73.14 | 73.90 | 4.1 |
MoE版では、LLM-jp-4.1が上回ったのはJMMLUとMMLU-Proの2項目だけでした。32B-A3Bクラスで国産基盤のモデルを選ぶなら、現時点ではELYZA版が有力です。
開発アプローチと使い勝手の違い
比較項目 | ELYZA-Thinking-1.0(llm-jp-4版) | LLM-jp-4.1 |
|---|---|---|
開発元 | ELYZA | NII(LLM-jp) |
公開日 | 2026年10月2日 | 2026年9月28日 |
追加学習の方法 | 中間学習+SFT+強化学習(RLVR) | SFT+DPO(事後学習を改善) |
サイズ | 33B/32B-A3B | 8B/32B-A3B/33B |
思考の強さ(effort)切替 | なし(常に思考) | あり |
並列ツール呼び出し | 非対応 | 対応 |
公式GGUF | なし | あり |
ブラウザ・APIで試す手段 | なし | 東京大学のmdx-MaaSで試験提供予定(10月中旬から募集) |
ライセンス | Apache 2.0 | Apache 2.0 |
性能はELYZA版が上回る項目が多い一方、手軽さはLLM-jp-4.1が上です。8Bモデルがあり、公式GGUFでローカルPCでも動かしやすく、mdx-MaaSでGPUなしに試せる見込みもあります。LLM-jp-4 33B系のGGUFや必要VRAMはLLM-jp-4 33Bとは?で詳しく解説しています。
Qwen3.5・Gemma 4など海外モデルとの比較
総合力では、海外の最新オープンモデルに及びません。ELYZA自身の公表値でも、同クラスのQwen3.5やGemma 4に総合平均で約6〜10ポイントの差をつけられています。
モデル | 構造 | 全体平均 | 日本語平均 | JEMHopQA | JFBench |
|---|---|---|---|---|---|
Gemma 4 31B | Dense | 70.54 | 68.88 | 63.91 | 35.68 |
Qwen3.5-27B | Dense | 68.18 | 66.05 | 62.87 | 34.12 |
ELYZA-Thinking-1.0 33B | Dense | 61.69 | 62.18 | 73.85 | 39.02 |
Qwen3-32B | Dense | 58.11 | 58.97 | 58.62 | 21.42 |
Gemma 4 26B-A4B | MoE | 68.58 | 66.68 | 61.93 | 30.30 |
Qwen3.5-35B-A3B | MoE | 66.37 | 64.24 | 58.88 | 28.83 |
ELYZA-Thinking-1.0 32B-A3B | MoE | 58.46 | 59.61 | 71.59 | 38.15 |
gpt-oss-20b | MoE | 57.26 | 55.04 | 54.16 | 18.38 |
出典: ELYZA公式モデルカード
それでも、JEMHopQA(日本語の複数段階の知識QA)とJFBench(日本語の複雑な指示追従)では、比較対象のどのモデルよりも高いスコアです。数学(AIME)、コーディング(LiveCodeBench)、ツール呼び出し(BFCL)では海外モデルとの差が大きく、AIMEではGemma 4 31Bの88.75に対してELYZA 33Bは68.85でした。
「総合力が欲しい」ならGemma 4やQwen系、「国産基盤であること」と「日本語の知識・指示追従」を重視するならELYZA-Thinking、という選び方になります。海外モデルの詳細はGemma 4使い方・性能比較・モデルサイズ完全解説やQwen3.8-27Bとは?を参照してください。
学習方法と「AIによるAI開発」(ELYZA RSI Research)
ELYZA-Thinking-1.0の特徴は、性能だけでなく作り方にもあります。ELYZAによると、中間学習から事後学習・評価までの一連の工程を、AIエージェント中心で回しました。人間が手を動かした作業は1〜2人日程度だったと説明しています。
3段階の学習
段階 | 内容 |
|---|---|
中間学習 | 数学・コード・STEMの問題を日本語に翻訳し、推論過程を新たに生成(英語の元データも残す)。エージェント用データも日本語化(ツール名・引数・JSONはそのまま) |
SFT | 思考過程つきの合成データ数百万件(約半分が日本語)。教師モデルの回答のうち、数式の等価判定・ユニットテスト・ルールチェッカーで正しさを確認できたものだけを採用 |
強化学習(RLVR) | 数学・コード・日本語知識・複雑な指示追従・ツール利用をまとめて1回で学習。報酬はプログラムで自動計算。「解けたり解けなかったりする」難易度の問題を選び、解かずに点を取れる抜け道を事前に塞いだ |
日本語の知識は、最新の日本語WikipediaとWikidataから合成したデータで学習しています。JamC-QAやJEMHopQAのスコアが高いのは、この工程の効果と考えられます。
ELYZA RSI Researchとの関係
モデル公開と同じ10月2日、ELYZAは「再帰的自己改善(RSI)」を研究する組織「ELYZA RSI Research」を立ち上げました。RSIは、AIが自分自身の開発・改善を担っていく考え方です。ELYZA-Thinking-1.0は、この研究の成果の1つとして公開されました。
同時に、カスタマーセンター業務のエージェントを評価するベンチマーク「ELYZA Agent Tasks: Customer Service」や、自律改善エージェントの実験結果も発表されています。ビジネス+ITの報道では、未知のテストデータでのタスク完遂率が34.3%から52.9%に上がり、推論コストを67%削減したとされています。
ただし、ELYZA自身は「RSIが実現したわけではなく、RSIに向けた要素技術の研究」と位置付けています。「AIが自分でAIを作った」という段階ではない点は押さえておきましょう。ELYZAの最近の動きはELYZAのAIアプリ生成特許が炎上でも取り上げています。
料金・ライセンス

出典:Hugging Face(elyza/ELYZA-Thinking-1.0-llm-jp-4-33b)
モデル自体は無料です。Hugging Faceからダウンロードでき、ライセンス料も利用料もかかりません。実際にかかるのはGPUのコストです。
項目 | 内容 |
|---|---|
モデル利用料 | 無料 |
ライセンス | Apache 2.0 |
商用利用 | 可 |
改変・再配布 | 可(LICENSEの同梱、NOTICEの保持、改変箇所の明示が必要) |
ELYZA公式API | 確認できず |
実質コスト | GPUサーバー(80GB級GPU×1枚以上が目安)の購入・レンタル費用 |
NOTICEファイルには、本モデルがllm-jp-4ベースモデルの派生物であることが記載されています。社内で改変したモデルを配布・提供する場合は、このNOTICEを残してください。
クラウドGPUを借りる場合はH100/A100 80GBクラスのインスタンスが選択肢になります。料金は事業者やリージョンで大きく変わるため、事前に見積もりを取りましょう。GPUを用意せずに日本語特化LLMを使いたい場合は、Sakana Namazuとは?のようなAPI提供型のサービスも比較対象になります。
使い方(vLLM/Transformers/ツール呼び出し)

公式が推奨しているのはvLLMでの運用です。OpenAI互換のAPIサーバーとして立ち上げれば、既存のOpenAI SDKやアプリからそのまま呼び出せます。
vLLMで起動する(推奨)
公式モデルカードでは、vLLM 0.30.0で動作を検証しています。リポジトリに含まれる専用プラグイン(思考の分離とツール呼び出しの解析用)をダウンロードしてから起動します。
pip install vllm==0.30.0
pip install flashinfer-jit-cache==0.6.18.post1 --extra-index-url https://flashinfer.ai/whl/cu130
# 専用プラグインを取得
hf download elyza/ELYZA-Thinking-1.0-llm-jp-4-33b --include "vllm_plugins/*" --local-dir .
# サーバー起動
vllm serve elyza/ELYZA-Thinking-1.0-llm-jp-4-33b \
--max-model-len 65536 --trust-remote-code \
--reasoning-parser-plugin vllm_plugins/multi_parser_loader.py --reasoning-parser llmjp4 \
--tool-parser-plugin vllm_plugins/llmjp_harmony_tool_parser.py --tool-call-parser llmjp_harmony \
--enable-auto-tool-choice32B-A3Bを使う場合は、モデル名を elyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b に変え、--moe-backend triton を追加します。
起動後は http://localhost:8000/v1/chat/completions にOpenAI形式でリクエストを送ります。
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
res = client.chat.completions.create(
model="elyza/ELYZA-Thinking-1.0-llm-jp-4-33b",
messages=[{"role": "user", "content": "日本の三大祭りを、ふりがな付きで説明してください。"}],
temperature=0.6,
top_p=0.95,
)
print(res.choices[0].message.content)回答本文は content に入り、思考過程は別のフィールドで返ります。アプリ側で思考過程を表示するかどうかを選べます。
ツール呼び出し
ツールはOpenAI標準の tools フィールドで定義します。vLLMのツールパーサーを有効にしておけば、追加の設定なしで tool_calls として結果が返ります。
tools = [{
"type": "function",
"function": {
"name": "get_weather",
"description": "指定した都市の天気を取得する",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"],
},
},
}]
res = client.chat.completions.create(
model="elyza/ELYZA-Thinking-1.0-llm-jp-4-33b",
messages=[{"role": "user", "content": "札幌の天気を教えて"}],
tools=tools,
)
print(res.choices[0].message.tool_calls)複数のツールを同時に呼ぶ「並列ツール呼び出し」には対応していません。複数ツールを使うエージェントでは、1回ずつ順番に呼び出す設計にしてください。
Transformersで動かす
検証用にPythonから直接動かすなら、Transformers(4.57.6/5.18.0で検証済み)も使えます。
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "elyza/ELYZA-Thinking-1.0-llm-jp-4-33b"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id, dtype=torch.bfloat16, device_map="auto", trust_remote_code=True
)
messages = [{"role": "user", "content": "敬語の種類を3つ挙げて説明してください。"}]
inputs = tokenizer.apply_chat_template(
messages, add_generation_prompt=True, return_tensors="pt"
).to(model.device)
outputs = model.generate(
inputs, max_new_tokens=16384, do_sample=True, temperature=0.6, top_p=0.95
)
print(tokenizer.decode(outputs[0][inputs.shape[-1]:]))出力はharmony形式で、思考と回答が混ざった状態で返ります。モデルカードでは、リポジトリ内の parse_harmony_message() で思考チャネルと回答を分ける方法が案内されています。
推奨設定のまとめ
設定 | 推奨値 |
|---|---|
temperature | 0.6 |
top_p | 0.95 |
max_new_tokens | 16,384程度(思考の分を見込む) |
最大出力の目安 | コンテキスト長−4,096トークン |
思考のオン/オフ | 切替なし(常にオン) |
Mac・Ollamaで動くか
Apple Silicon向けには、コミュニティ製の32B-A3B MLX 4bit量子化版(rariruluis/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b-mlx-4bit)が公開されています。ELYZA公式ではないため、動作や品質は自分で確認してください。
OllamaやLM Studioでの公式サポートは、現時点で確認できていません。元のLLM-jp-4系は独自トークナイザの関係で、llama.cpp本家ではなくLLM-jp版のforkが必要とされており、ELYZA版でも同じ注意が必要になる可能性があります。Ollamaの基本はOllamaとは?使い方・対応モデル・必要スペックで解説しています。
出典: Hugging Face 公式モデルカード(33B)
できないこと・注意点(セキュリティ含む)
導入前に必ず確認しておきたいのは、「GPUなしでは試せない」「常に思考するのでコストがかさむ」「trust_remote_code が必須」の3点です。
機能面の制約
制約 | 内容 | 影響 |
|---|---|---|
テキストのみ | 画像・音声の入力は不可 | 図表や帳票の読み取りには使えない |
コンテキスト64K | 長い資料をまとめて入れにくい | 256KのPLaMo 3.0 Primeなどより短い |
常に思考する | effort切替なし | 短い質問でもトークン消費と待ち時間が増える |
並列ツール呼び出し非対応 | harmony形式の制約 | エージェント設計に工夫が必要 |
小型モデルなし | 8B等はない | ノートPCでは動かしにくい |
公式量子化版なし | GGUF等は未公開 | 一般的なGPUでの運用は現時点で難しい |
安全性評価の記載なし | モデルカードにガードレールの説明なし | 有害出力対策は利用者側で用意する |
長文を扱いたい場合は、PLaMo 3.0 Primeとは?も比較してみてください。
セキュリティ面の注意
trust_remote_code=Trueの扱い: リポジトリ内のPythonコード(独自トークナイザやharmonyパーサー)が手元で実行されます。企業で導入する場合は、コードをレビューしたうえで、revision=でコミットを固定して使うのが安全です- 推論サーバーの公開設定: vLLMはそのままだと認証なしでAPIを受け付けます。ポートを外部に開けない、APIキーやリバースプロキシで保護するなどの対策が必要です
- 思考過程のログ: 思考過程にも入力した機密情報が含まれることがあります。ログ保存やユーザーへの表示をどうするか、事前に決めておきましょう
- ツール連携の権限: 社内システムとつなぐ場合、モデルに渡す権限は最小限にしてください
- 教師モデルの扱い: SFTに使われた教師モデルの名称は公開されていません。厳しいコンプライアンス要件がある場合は、この点も確認対象になります
一方で、重みを手元に置いて動かせるため、入力データを外部のAPIに送らずに済みます。機密情報や個人情報を扱う業務では、この点が大きなメリットです。
こんな人におすすめ/おすすめしない人
ELYZA-Thinking-1.0は、国産基盤のモデルを自社のGPU環境で動かしたい組織向けです。手軽に試したい個人や、総合性能を最優先したい人には向きません。
こんな人におすすめ
- 社内規定や取引先の要件で「国産基盤のLLM」を求められている企業
- 機密データ・個人情報をオンプレミスやプライベート環境だけで処理したい組織
- 日本の制度・地名・文化などの知識QAや、細かい日本語の書式指定が重要な業務を持つ人
- 80GB級のGPUを用意でき、vLLMの構築に慣れている開発者・研究者
- 国産LLMをベースに、自社データで追加学習したい研究チーム(Apache 2.0で改変可)
おすすめしない人
- GPUを持っておらず、まずブラウザで試したい人 → ChatGPTやClaudeなどのSaaS、またはLLM-jp-4.1のmdx-MaaS(試験提供予定)
- 総合性能・数学・コーディングを最優先したい人 → Gemma 4やQwen3.5系
- 画像入力や64Kを超える長文処理が必要な人 → マルチモーダル対応モデルやPLaMo 3.0 Prime
- ノートPCやゲーミングPCで手軽に動かしたい人 → LLM-jp-4.1-8bやGemma 4 12B
- プログラミングをせずに使いたい人
目的別の選び方
やりたいこと | おすすめのモデル |
|---|---|
国産基盤で日本語の知識QA・指示追従を重視 | ELYZA-Thinking-1.0 33B |
国産基盤で応答速度と同時処理数を重視 | ELYZA-Thinking-1.0 32B-A3B |
国産基盤で数学・ツール呼び出しを重視 | LLM-jp-4.1-33b-thinking |
国産基盤を小さいGPUで動かしたい | LLM-jp-4.1-8b-thinking(公式GGUFあり) |
GPUなしで国産モデルを試したい | LLM-jp-4.1(mdx-MaaS、試験提供予定) |
国産にこだわらず総合性能を重視 | Gemma 4 31B/Qwen3.5-27B |
長文(256K)を扱いたい | PLaMo 3.0 Prime |
NTTの国産LLMも候補に入れたい方は、NTT tsuzumi 2とは?もあわせてご覧ください。
よくある質問
Q. ChatGPTのように会話画面で使えますか?
現時点ではELYZA公式のチャット画面はありません。vLLMでサーバーを立てたうえで、Open WebUIなどOpenAI互換APIに対応したチャットUIを接続すれば、社内向けにChatGPTに近い画面を作れます。
Q. 商用サービスに組み込む場合の条件は?
Apache 2.0なので、利用料なしで商用サービスに組み込めます。条件は、LICENSEの同梱、NOTICE(llm-jp-4ベースモデルの派生物である旨)の保持、改変した場合の明示です。出力した文章の権利や、出力内容に対する責任は利用者側で管理する必要があります。
Q. LLM-jp-4.1をファインチューニングしたモデルですか?
違います。ELYZA-Thinking-1.0は、LLM-jp-4のベースモデル(事前学習のみの状態)にELYZAが独自に追加学習したモデルです。LLM-jp-4.1はNIIが同じベースモデルから作った別系統の推論モデルで、両者は兄弟のような関係です。
Q. 英語でも使えますか?
対応言語は日本語と英語です。英語平均は33Bで59.72と、LLM-jp-4.1(59.11)とほぼ同じ水準です。英語中心の用途なら、Gemma 4やQwen3.5系のほうがスコアは高くなっています。
Q. 公開されたベンチマークの数値は信頼できますか?
数値はすべてELYZA自身による評価です。評価条件(temperatureやreasoning effortの設定、並列ツール呼び出しの除外など)はモデルカードに公開されていますが、第三者による再現は現時点で確認できていません。導入時は、自社の業務データで小規模に検証することをおすすめします。
Q. 今後、小型版やAPI提供は出ますか?
現時点でELYZAからの発表はありません。NII側は次期LLM-jp-4.2で強化学習による推論・エージェント能力の強化を予定しており、国産基盤モデルの選択肢は今後も増えていく見込みです。
まとめ
ELYZA-Thinking-1.0(llm-jp-4版)は、NIIが国内でゼロから事前学習したLLM-jp-4を土台に、ELYZAが強化学習まで行った日本語推論モデルです。
- 33B(Dense)と32B-A3B(MoE)の2モデル。Apache 2.0で無料、商用利用可
- ELYZA公表値ではLLM-jp-4.1を総合平均で上回った(33Bは+約1ポイント、32B-A3Bは+約4.6ポイント)
- 日本語の知識QAと指示追従が強み。33Bの数学とツール呼び出しはLLM-jp-4.1が上
- 総合平均は同クラスのQwen3.5・Gemma 4に約6〜10ポイント及ばない
- 公式API・公式量子化版はなく、80GB級GPUとvLLMの構築が前提
- 「完全国産」なのは土台の事前学習まで。構造はLlama系・Qwen3 MoE系で、SFTの教師モデルは非公開
国産基盤であることと日本語の精度を重視し、自社GPUで運用できる組織にとっては有力な選択肢です。手軽さを重視するならLLM-jp-4.1、総合性能を重視するなら海外オープンモデルと比べたうえで決めてください。国産LLM全体の位置づけは国産LLM 7選 徹底比較で確認できます。
このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します
業務を1つ送るこの記事の著者

AI革命
編集部
AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。
最新記事

システム開発の納品物一覧と著作権|ソースコードは誰のもの?AI開発で増える引き継ぎ資料も【2026年10月】
2026/09/15

Gemini 4 Argonとは?出力100万トークン・API料金・いつ使えるか・GPT-6 Astra/Opus 5.5比較【2026年10月】
2026/10/02

AI開発の期間・進め方・費用の目安|相談から稼働まで何ヶ月か【2026年10月最新】
2026/09/10

ChatGPT Pro 500とUltrafastとは?月500ドルの中身・Pro 100/200/500の違い・値上げ批判と選び方【2026年10月】
2026/10/02

ChatGPT利用制限リセットとは?10月3日に全有料ユーザー再リセット|3種類の違い・履歴・失効期限【2026年10月最新】
2026/09/08

GPT-6.1 Solとは|Astra並み性能を5分の1の料金で・API料金(入力2ドル/出力10ドル)・105万トークン・GPT-6 Sol/Astraとの違い【2026年9月】
2026/10/02


