AIツール2026年9月更新

Qwen3.8-27Bとは?必要VRAM・商用利用・使い方を実測データで解説

公開日: 2026/08/16
更新日: 2026/09/05
Qwen3.8-27Bとは?必要VRAM・商用利用・使い方を実測データで解説

この記事のポイント

Qwen3.8-27B(Qwen 3.8 27B)はApache 2.0で商用利用できる270億パラメータのマルチモーダルLLM。コンテキスト長別の必要VRAM実測、GPU別の生成速度、Ollama/vLLMでの動かし方、Qwen3.8シリーズのライセンス差までまとめました。

Qwen3.8-27B は、Alibaba Cloud の Qwen(通義)チームが2026年8月14日(日本時間15日)に Apache 2.0 ライセンスで公開した、270億パラメータのマルチモーダル・オープンウェイトLLMです。 画像と動画も入力でき、ネイティブで262,144トークン(262K)の文脈を扱い、4bit量子化すれば VRAM 24GB のGPU 1枚で常用できます。

ローカル実行を検討している方が最初に知りたいのは「自分のGPUで動くのか」でしょう。4bit量子化のウェイトは16.7〜19GB ですが、64Kの文脈を積むと実測で約22GB、128Kなら約26GB を使います。「17GBのファイルだから17GBのVRAMで足りる」は誤りです。常用ラインは24GB、長文を扱うなら32GBが現実的な目安になります。

扱う範囲は、2026年9月5日時点で確認できた一次情報と第三者の実測値です。

  • コンテキスト長別・GPU別の必要VRAMと生成速度(第三者の実測値)
  • 「Qwen3.8」を名乗る4モデルの違いとライセンス(Apache 2.0 なのは 27B だけ
  • Ollama / LM Studio / vLLM / SGLang での動かし方
  • 公式ベンチマークと第三者評価(Artificial Analysis でオープンウェイト1位)
  • ローカル / OpenRouter / Cerebras / Alibaba Cloud のどこで動かすと速く・安いのか
  • ローカル実行でも残るセキュリティリスク(無検閲化された派生モデルを掴む問題を含む)

社内データを外に出さずにLLMを動かしたい企業の技術担当者、自前GPUでコーディングエージェントを回したい開発者、ローカルLLM用マシンの購入を検討している個人に向けた内容です。

Qwen3.8-27Bはどんなモデルか|性能・ライセンス・速度の要点

  1. 「27Bクラスで最強級」だが「フロンティア置き換え」ではない。 Qwen公式発表値では Terminal-Bench 2.1 が 73.0、PC操作の OSWorld-Verified が 84.3 と、前世代 Qwen3.6-27B を大きく上回ります。ただし同じ Terminal-Bench で Claude Opus 4.8 は 78.9、DeepSWE 1.1 では GPT-5.6 が 72.7(Qwen3.8-27B は 42.2)とされ、難度の高い自律コーディングでは差が残ります。
  2. 第三者集計では「オープンウェイト1位」。 公開直後は自己申告値しかありませんでしたが、現在は Artificial Analysis が Intelligence Index に掲載しており、同社の集計ではオープンウェイトモデル140件中1位という位置づけです(指数の絶対値は集計時期で食い違いがあるため、相対順位で読むのが安全です)。
  3. Apache 2.0 で商用利用できるのは「27B」だけ。 同時期に公開された Qwen3.8-2.4T-A95B は独自ライセンスで条件が異なります。混同すると法務判断を誤ります。
  4. 速度の選択肢が一気に広がった。 ローカルでは RTX 5090 + NVFP4 で150〜200 tok/s の報告があり、クラウド側では2026年9月3日に Cerebras Inference が約1,500 tokens/s での提供を開始しました。Hacker News で676ポイントを集めるほど注目されていますが、コンテキスト上限やレート制限といった制約も指摘されています。

迷ったときの判断はシンプルです。機密データを外に出せない/トークン課金の上限を気にせず長時間エージェントを回したいならローカル実行の価値が大きく、単にコストを下げたいだけならAPI経由のほうが安く済むケースが大半です。

Qwen3.8-27Bは自分のGPUで動くのか|必要VRAM早見表(実測)

Qwen3.8-27Bのローカル実行に必要なGPUとVRAMのイメージ

以下は Hardware Corner が2026年8月に公開した実測レポート(Q4_K_S ビルド=16.68GiB、27.32Bパラメータ)に基づく数値です。

ウェイトサイズ=必要VRAM ではない

実際に必要なメモリは次の合計です。

必要VRAM = ウェイト + KVキャッシュ + アクティベーション等のオーバーヘッド

KVキャッシュはコンテキスト長と同時実行数にほぼ比例して増えます。同じ4bitモデルでも、扱う文脈の長さで必要量がここまで変わります。

使用するコンテキスト長

実測のVRAM使用量

4K

18 GB

64K

22 GB

128K

26 GB

256K

34 GB

つまり、ウェイトが16.68GiB でも、128Kのコードベースを読ませれば26GBを使います。「17GB前後のGGUFなら20GBのGPUで余裕」という見立ては、短い文脈でしか成立しません。

GPU別のトークン生成速度(実測)

GPU(VRAM)

4K

64K

128K

256K

RTX 3090(24GB)

40.31 tok/s

33.95 tok/s

RTX 4090(24GB)

46.16 tok/s

38.41 tok/s

RTX 5090(32GB)

74.83 tok/s

22.79 tok/s

RTX 5060 Ti ×2(約16GB×2)

22.47 tok/s

15.55 tok/s

Apple M5 Max(統合128GB)

31.4 tok/s

18.2 tok/s

NVIDIA GB10(DGX Spark系)

12.20 tok/s

5.94 tok/s

同レポートの結論は「24GBが長文用途の実用的な出発点。24GBなら64Kがエージェント用途の現実的な運用目標。RTX 5090(32GB)なら生成速度と引き換えに128Kが可能」というものです。

ただし同じGPUでも構成次第で一桁変わります。RTX 5090 の例だけでも、日本語の実測記事(Zenn / secure_auto_lab、Ollama v0.32.0)では 152 tok/s(前世代 Qwen3.6-27B の 64 tok/s の約2.4倍)、NVFP4 + 投機的デコードでは 200 tok/s 超という報告があります。一方で128Kの長文を積めば 22.79 tok/s まで落ちます。量子化形式・コンテキスト長・推論エンジンの3つで決まると考えてください。

量子化別のサイズと実用VRAM

精度

ウェイト概算

実用VRAMの目安

備考

BF16(公式)

約56GB

80GB以上

H100 / H200 クラス

FP8(公式)

約28GB

48GB以上

L40S / RTX PRO 6000。262Kフル文脈は厳しい

NVFP4

約16.5GB

24GB〜

RTX 5090(Blackwell)向け。SGLang 公式クックブックが推奨構成として記載

8bit GGUF

約31GB

32GB〜

6bit GGUF

約24GB

24〜32GB

4bit GGUF(Q4_K_S / Q4_K_M)

16.68〜19GB

24GB(64Kまで)/32GB(128K)

常用の下限。最も現実的

3bit GGUF

約13〜16GB

16GB級(一部オフロード)

2bit GGUF(UD-Q2_K_XL)

約11〜13GB

12〜16GB

1bit(Unsloth UD-IQ1_S)

6.2GB

8GB級

元比約89%圧縮。エージェント用途には不適

2026年8月19日に Unsloth が発表した Dynamic v3.0 により、Qwen3.8-27B の1bit版が6.2GBまで圧縮されました(top-1%精度を約72%維持、MTPモジュールを除外)。数字だけ見ると魅力的ですが、Unsloth 自身が用途を限定しています。1bit版は32トークン先の予測精度が2bit版の約25%からさらに8〜10%以下へ急落するとされ、presence_penalty を1.5以上にする、thinking を low 以上にしないと空出力になる、といった注意が必要です。長時間のエージェント運用には使えないと考えるのが安全です(なお「他社量子化版比で+10%」という比較は Unsloth の自社測定であり、第三者検証は確認できていません)。

環境別の判断ライン

環境

判定

VRAM 8〜12GB

1〜2bit なら起動する。品質劣化が大きく試用レベル。エージェント用途は不可

VRAM 16GB(RTX 5070 Ti 等)

4bitは載り切らずCPUオフロードが必要。3bitなら可。実用には工夫が要る

VRAM 24GB(RTX 3090 / 4090)

4bit+64Kが常用ライン。40〜46 tok/s

VRAM 32GB(RTX 5090)

128Kが現実的。NVFP4なら150〜200 tok/s の報告も。費用対効果が最も高い

48GB(L40S / RTX PRO 6000)

公式FP8が現実的。262Kフル文脈は厳しい

80GB(H100 / H200)

公式BF16+ネイティブ262Kで安全圏

Apple Silicon(M5 Max 統合128GB)

4Kで31.4 tok/s。qwen3.8:27b-mlx あり。統合メモリはOSと共有するため余裕を見る

DGX Spark / GB10

動くが遅い(4Kで12.2 tok/s)。並列処理向き

VRAM 16GB での実測レポート(Qiita / RTX 5070 Ti + WSL2 + Ollama)では、Q4_K_M(約19GB)が載り切らずGPU約70%/CPU約30%のオフロード配分となり、体感できる応答遅延が発生したと報告されています。16GBでも「動く」が、常用したいなら24GB以上というのが現実的な線引きです。

節約策としては、KVキャッシュ自体の量子化(llama.cpp系で q8_0 を指定すると既定のf16に対して概ね半分)と、Flash Attention の有効化が定番です。

Qwen3.8シリーズは4モデルある:「Qwen3.8=Apache 2.0」は誤り

QwenシリーズのGitHub公式リポジトリ。ライセンス条文はモデル単位で確認する

出典: GitHub「QwenLM/Qwen3」公式リポジトリ

「qwen3.8」とだけ検索した方が最初に混乱するのがここです。2026年8月に「Qwen3.8」の名前で複数のモデルが登場しましたが、ライセンスもモダリティも別物です。

モデル

位置づけ

規模

ライセンス

モダリティ

入手性

Qwen3.8-27B

ローカル向け Dense

27B

Apache 2.0

テキスト+画像+動画

HF / ModelScope / Ollama

Qwen3.8-2.4T-A95B

大規模MoEのオープンウェイト版

2.4T total / 95B active

独自ライセンス「qwen3.8-max」

テキストのみ(Vision非対応)

Hugging Face

Qwen3.8-Max

Qwen Cloud のホスト型API(2.4T-A95Bベース)

同上

商用API利用規約

画像入力あり

APIのみ

Qwen3.8-Flash-Next(2026/8/26公開)

Qwen4アーキテクチャの先行プレビュー

125B total / 6B active MoE

オープンウェイト(条件は要確認)

マルチモーダル

HF / ModelScope

つまり、Apache 2.0 で自由に商用利用・再配布・派生モデル配布ができるのは 27B のみです。2.4T-A95B は「オープンウェイト」ではあってもライセンス条文が別で、事業規模によって追加要件が発生するとされています(条文の具体的制限は未確認のため、利用前に必ず原文を確認してください)。

多くの記事が「Qwen3.8がApache 2.0で公開」とまとめていますが、法務レビューに通すのであればモデル名単位で確認が必要です。上位モデルの詳細は Qwen3.8-Maxの解説記事、次世代アーキテクチャのプレビュー版は Qwen3.8-Flash-Nextの解説 で扱っています。Qwenシリーズの系譜としては Qwen 3.7 MaxQwen3.6-Plus も参考になります。

Qwen3.8-27Bの基本スペックとアーキテクチャ

Qwen(通義)チームのHugging Face公式Organizationページ

出典: Hugging Face「Qwen」公式Organizationページ

Qwen3.8-27B は、テキストに加えて画像・動画を理解できる Dense(非MoE)モデルです。Hugging Face と ModelScope からウェイトをダウンロードして自己ホストできます。

項目

内容

正式名称

Qwen3.8-27B(表記ゆれ: Qwen 3.8 27B / qwen3.8-27b)

開発元

Alibaba Cloud / Qwen(通義)チーム

モデル種別

ネイティブ・マルチモーダル(Vision-Language)Denseモデル

パラメータ数

27B(実測 27.32〜27.78B。FP8版の表記は「28B params」)

ライセンス

Apache 2.0(商用利用・改変・再配布可)

公開日

2026年8月14日 15:00 UTC(日本時間8月15日 0:00)

コンテキスト長

ネイティブ262,144トークン/YaRN適用で最大約100万トークンまで拡張可

入出力

入力=テキスト・画像・動画/出力=テキストのみ(音声は非対応

前世代

Qwen3.6-27B(2026年4月公開)

ダウンロード実績

Hugging Face 5.7M+ / Ollama 1.5M(2026年9月時点)

なぜ27Bで長文が現実的に回るのか

日本語の解説記事ではあまり触れられていませんが、Qwen3.8-27B の長文処理はアーキテクチャ側の工夫に支えられています。公式モデルカードによれば、レイヤ構成は次のようなハイブリッド型です。

16 × ( 3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN) )
  • Gated DeltaNet(線形アテンション)3層に対して、フルアテンション(Gated Attention)1層という比率で混成
  • 隠れ層次元 5,120/64レイヤ/FFN中間次元 17,408
  • 学習には Multi-Token Prediction(MTP)を使用

線形アテンション主体にすることで、文脈長に比例して膨らむKVキャッシュを抑えるのが狙いです。262Kという長さを27Bクラスで実用域に持ち込めているのも、前世代と同じ27Bでありながら実測で2倍以上の生成速度が出るのも、この構成が効いていると考えられます。

裏を返すと、推論エンジン側がこのハイブリッド構成に対応していないと正しく動きません。vLLM や SGLang にバージョン要件があるのはこのためです。

Qwen3.8-27Bの使い方:4つの実行ルート

社内APIとして立てる際に使う推論エンジンvLLMの公式リポジトリ

出典: GitHub「vllm-project/vllm」公式リポジトリ

用途と手持ちの環境によって、選ぶべきルートが変わります。

ルート

難易度

向いている場面

備考

Ollama / LM Studio(GGUF)

まず個人PCで試す

第三者量子化。手軽さ最優先

llama.cpp(GGUF)

細かいパラメータ制御

KVキャッシュ量子化などを自分で調整

vLLM

中〜高

社内サーバでのAPI提供

OpenAI互換エンドポイント

SGLang

中〜高

高スループット運用

ハイブリッドGDN向けフラグあり

1. Ollama 公式ライブラリから最短で試す

もっとも手軽なルートです。2026年9月時点で Ollama の公式ライブラリに qwen3.8 が掲載されており(サイズ18GB、コンテキスト256K、Text+Image入力、Thinking内蔵)、次の1行で動きます。

ollama run qwen3.8:27b

Apple Silicon 向けには qwen3.8:27b-mlx タグも用意されています。VRAMが足りない場合は、Unsloth の GGUF をタグ指定して量子化レベルを落とします。

# より軽い量子化版を指定してロードする例
ollama run hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q2_K_XL

まず動かして体感速度を測り、そのうえで量子化レベルを上げ下げするのが確実です。LM Studio / Jan / llama.cpp でも同じGGUFを直接ロードできます。

2. vLLM で社内APIとして立てる

vLLM は公式レシピを提供しており、OpenAI互換の /v1 エンドポイントが立つため既存のクライアントコードをほぼそのまま使えます。

pip install vllm
vllm serve "Qwen/Qwen3.8-27B"

262Kを超える長文(YaRNによる拡張)を使う場合は、config.json にYaRN設定を指定します。

{
  "rope_type": "yarn",
  "rope_theta": 10000000,
  "factor": 4.0,
  "original_max_position_embeddings": 262144
}

vLLM から指定する場合は VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 を付けたうえで --max-model-len--hf-overrides を併用します。

注意点として、100万トークンはネイティブ性能ではありません。 YaRN による外挿であり、精度と速度のトレードオフを伴います。「1Mコンテキスト対応」という表現だけを見て設計しないでください。

3. SGLang で高スループットを狙う

SGLang にも公式クックブックがあります。ハイブリッドGDN系モデルでは --mamba-full-memory-ratio(既定0.9)がスループットに効くとされており、ここのチューニングが実効性能を左右します。同クックブックは RTX 5090 級のGPUに対して NVFP4(約16.5GB)構成を推奨しています。

4. 公式が保証する範囲を把握しておく

Qwen が公式に提供・保証しているのは BF16 と FP8(ブロックサイズ128の細粒度量子化、「元モデルとほぼ同等」と記載)のみです。GGUF・AWQ・NVFP4 などは第三者による変換であり、品質は自己責任になります。

Hugging Face 上には量子化・派生モデルが大量にアップロードされていますが、業務利用では出所を絞ってください。 公式リポジトリ(Qwen/Qwen3.8-27BQwen/Qwen3.8-27B-FP8)、Ollama 公式ライブラリ、または Unsloth のように実績のあるアップローダに限定するのが無難です。

推奨サンプリングパラメータ(公式)

公式モデルカードはモードごとに異なる設定を推奨しています。既定値のまま使うと性能を出し切れません。

モード

temperature

top_p

top_k

presence_penalty

Thinking

1.0

0.95

20

0.0

Instruct(非Thinking)

0.7

0.80

20

1.5

Qwen3.8-27Bでできること

1. 画像・動画の理解

STEM分野の図表、スキャンした文書、グラフ入りPDF、数分〜数時間の長尺動画の理解に対応します。文書解析系の OmniDocBench 1.5 では 91.1(公式発表値)と、OCR・レイアウト解析用途にも耐える水準が示されています。

一方で音声の入出力には対応していません。音声込みで扱いたい場合は Qwen 3.5-Omni のようなOmni系モデルが別途必要です。

2. Thinking(熟考)モードの3段階制御

既定でThinkingがONになっており、<think>...</think> ブロックを生成しながら推論します。特徴はリクエスト単位でOFFにでき、深さも3段階から選べることです。

設定

用途の目安

xhigh(既定)

難問のコーディング・数学・多段推論

medium

一般的な業務タスク

low

短い質問応答・分類・整形

OFF(Instructモード)

定型処理、レイテンシ重視

APIでは reasoning_effort パラメータで指定します。また Preserved Thinking(過去メッセージのthinkingブロックを保持して一貫性を上げる機能)が備わっており、preserve_thinking: false で無効化できます。

ここは実務上かなり重要です。既定の xhigh のままだと簡単な質問にも推論トークンを大量消費します。ローカルでは体感速度の低下、API経由では課金額に直結するため、タスクに応じた設定変更を前提に組んでください。

なお medium にすれば必ず節約になるとは限りません。DGX Spark で計測した第三者レポートでは、medium が入力約860K/出力38Kトークン、xhigh が入力約500K/出力60Kトークンと、medium のほうが総トークンを多く消費する逆転が観測されています。設定は自分のワークロードで実測して決めるのが確実です。

3. エージェントとしての実行能力

Qwen3.8-27B の売りは、テキスト生成よりむしろエージェント方向です。公式発表値ではPC操作の OSWorld-Verified が 84.3、モバイル操作の AndroidWorld が 81.9、ブラウザ操作の WebArena-Verified が 64.8 とされています。

  • 自律的な計画立案と、環境フィードバックを受けた再計画
  • マルチモーダルなツール呼び出し(画面を見ながらの操作)
  • 構造化出力(JSON等)への対応
  • 長時間タスクの完遂

ツール連携の標準規格については MCP(Model Context Protocol)の解説 も合わせて確認すると、実装イメージが掴みやすくなります。

4. ファインチューニングと派生モデルの配布

Apache 2.0 のため、LoRA等でファインチューニングした派生モデルを商用配布することも可能です(帰属表示とライセンス条文の同梱が必要)。Unsloth が Thinkingトグル付きの実行とLoRAファインチューニングに対応しています。

ベンチマーク:公式発表値と第三者評価を分けて読む

Qwen3.8-27Bのベンチマークスコアは公式値と第三者値を分けて読む必要がある

公開直後は Qwen 自身の発表値しかありませんでしたが、2026年9月時点では第三者集計も出そろっています。両者を分けて読むのが正しい向き合い方です。

Qwen公式発表値(テキスト・コーディング系)

ベンチマーク

Qwen3.8-27B

補足

Terminal-Bench 2.1

73.0

前世代 Qwen3.6-27B は 63.4(+9.6)

SWE-bench Pro

61.7

Claude Opus 4.6 Max 超えと主張

LiveCodeBench v6

90.3

QwenSWEBench

79.0

自社ベンチ

DeepSWE 1.1

42.2

Qwen3.6-27B は 13.3(+28.9)

NL2Repo-Bench

42.3

CoWorkBench(長時間オフィス業務)

70.7

IFBench(指示追従)

79.5

GPQA Diamond

89.2

HLE(Humanity's Last Exam)

30.8

Qwen公式発表値(マルチモーダル・エージェント系)

ベンチマーク

Qwen3.8-27B

補足

OSWorld-Verified(PC操作)

84.3

Qwen3.6-27B は 63.9(+20.4)

AndroidWorld(モバイル操作)

81.9

WebArena-Verified(ブラウザ操作)

64.8

OmniDocBench 1.5(文書解析)

91.1

MathVision(CI併用)

94.6

CharXiv(CI併用)

90.2

RealWorldQA

85.9

SWE-MM(マルチモーダルSWE)

38.6

前世代比 +12.9

ERQA(身体性知能)

65.5

第三者評価

評価元

指標

Artificial Analysis

Intelligence Index

オープンウェイト140件中1位(公式ページ現在値42、公開直後の報道値は52)

Artificial Analysis

Agentic Index

51(Kimi K2 に次ぐ2位との集計)

Artificial Analysis

出力速度 / TTFT

43.5 tok/s(140件中62位)/3.99秒(API経由の中央値)

Artificial Analysis

評価時の出力量

170Mトークン(全モデル中央値48M)、評価コスト $898.32

BenchLM.ai(2026/9/4更新)

総合スコア

68.35 / 100(411モデル中29位、422ベンチ中50をカバーの部分評価)

注意すべき点が2つあります。

ひとつは、Artificial Analysis の Intelligence Index が 42(同社ページの現在値)と 52(2026年8月17日の報道値)で食い違うことです。指数のバージョン差の可能性がありますが、確定情報は確認できていません。絶対値を引用するのではなく「オープンウェイトで1位」という相対順位で読むのが安全です。

もうひとつは、評価時の出力トークン量です。170Mトークンは中央値48Mの約3.5倍で、Thinking既定ONによるトークン浪費が客観的に数値化されたということでもあります。VentureBeat も「最適化なしでは深刻なレイテンシになる」と指摘しています。ローカルでもAPIでも、reasoning_effort の設計を後回しにすると痛い目を見ます。

フロンティアモデルとの距離

ベンチマーク

Qwen3.8-27B

比較対象

Terminal-Bench 2.1

73.0

Claude Opus 4.8 = 78.9

DeepSWE 1.1

42.2

GPT-5.6 = 72.7

難度の高い自律コーディングでは、依然として明確な差があります。 「27Bというサイズで、無料で、手元のGPUで動く」ことの価値が大きいのであって、クラウドのフロンティアモデルをそのまま置き換えられるという話ではありません。なお学習コーパス・学習トークン数・知識カットオフはいずれも非公開です。

なぜ中国系のオープンモデルがここまで存在感を持つようになったのかという背景は、中国製AIモデルの利用シェア動向 で整理しています。

どこで動かすか:ローカル / OpenRouter / Cerebras / Alibaba Cloud

OpenRouterのQwenモデル一覧ページ。API経由でQwen3.8系を利用できる

出典: OpenRouter「Qwen」公式モデルページ

Qwen3.8-27B は「ローカルで動かすモデル」と紹介されがちですが、2026年9月時点では提供チャネルが13プロバイダ以上に広がり、速度と価格が4倍以上の幅で分布しています。用途別に選ぶのが正解です。

チャネル

速度の目安

価格(100万トークン、入力/出力)

コンテキスト上限

向いている用途

ローカル(RTX 4090 24GB / 4bit)

40〜46 tok/s

電気代とGPU償却のみ

実質64K

機密データ、常時稼働、課金上限なし

ローカル(RTX 5090 32GB / NVFP4)

75〜200 tok/s

同上

128K

個人開発で最速級を狙う

OpenRouter(13プロバイダ集約)

P50 約70 tok/s

$0.22 / $2.42

1M(出力上限32,768)

コスト重視、まず試したい

Cerebras Inference

約1,500 tok/s

$0.99 / $1.49

無料枠64K/有料128K

待ち時間を消したい対話・エージェント

Alibaba Cloud Model Studio(国際)

記載なし

$0.575 / $3.45

1M

公式サポート、キャッシュ・バッチ割引あり

Qwen Cloud 公式ホスト版

未発表

1M(予定)

提供時期・価格とも2026年9月時点で "coming soon" のまま

モデル本体は無料

Apache 2.0 のオープンウェイトなので、モデル自体のライセンス費用はゼロです。かかるのはGPU・電力・運用工数だけです。Alibaba Cloud Model Studio は新規アカウントに対して有効化から90日間、対象モデルごとに100万トークンの無料枠を付与しています(モデル単位の個別付与で、共有ではありません)。

Cerebras の1,500 tok/s は速いが、制約も大きい

2026年9月3日に Cerebras Inference が Qwen3.8-27B の提供を開始し、約1,500 tokens/s という桁違いの速度で話題になりました。モデルIDは qwen-3.8-27b です。ただし Hacker News の議論では実務的な制約も多数指摘されています。

  • 有料でもコンテキストは128K上限(無料枠は64K)。長時間のエージェント運用には不足するという声
  • プロンプトキャッシュはあるが、キャッシュ読み出しも同額。他社のようなキャッシュ割引がない
  • レート制限に短時間で到達する報告がある(Developer ティアは300リクエスト/分、450K トークン/分)
  • あるユーザーの報告では、同一のコーディングタスクで Cerebras が $1.60/5.1分、OpenRouter が約 $0.29/14.4分。速いが約5倍高い

無料枠は Free Trial で5リクエスト/分・1日100万トークンまでです。「速さに金を払う価値があるか」で判断するチャネルだと考えてください。

損益分岐点をざっくり試算する

「GPUを買うべきか、APIで済ませるか」は次のように整理できます。以下は概算であり、為替1ドル=150円、コーディング用途で入力:出力=5:1という前提を置いた目安です。

  • API側(OpenRouter の $0.22/$2.42):入力100万+出力20万トークンで、およそ $0.70(約105円)
  • ローカル側:24〜32GB級GPU搭載機を仮に40万円として3年償却=月約11,000円、電気代を月2,000〜4,000円と見て、月13,000〜15,000円程度

この月額をAPIに置き換えると、おおむね月間1億トークン規模を消費してようやく釣り合う計算になります。個人利用や小規模チームでは、コストだけを理由にローカルGPUを買う合理性は薄いというのが率直な結論です。

ローカル実行の価値は金額ではありません。

  • 社外にデータを一切出せない(医療・金融・法務・自治体など)
  • レート制限や従量課金を気にせず、エージェントを長時間回したい
  • オフライン環境・閉域網で動かす必要がある
  • モデルを固定してバージョン変動の影響を受けたくない
  • ファインチューニングして自社仕様の派生モデルを持ちたい

これらが当てはまるなら、コスト比較の結果に関わらずローカル実行を選ぶ理由があります。逆にAPI経由で安く済ませたいだけなら、DeepSeek V4 Flash のような低価格帯モデルとの比較も検討の価値があります。OpenRouter 経由の利用を前提にする場合は、OpenRouterの買収報道 のような提供体制の変化にも目を配っておくとよいでしょう。

Qwen3.8-27Bの弱み・制約:導入前に把握すべき7点

  1. 音声の入出力に非対応。 テキスト・画像・動画のみで、出力はテキストだけです。
  2. 1Mコンテキストはネイティブではない。 ネイティブは262,144トークンで、100万トークンはYaRNによる外挿です。長さに応じて精度・速度が落ちます。
  3. Thinking既定ONによるトークン浪費。 Artificial Analysis の評価では出力170Mトークン(中央値の約3.5倍)を消費しました。設定変更を前提に運用設計してください。
  4. 動画のフレームサンプリング既定値が保守的。 時間スケールの長い動画は手動でのパラメータ調整が必要です。
  5. ニッチな事実知識に弱い。 特に日本語のローカルな話題でハルシネーションの報告があります。RAG等で外部知識を補うのが前提です。日本語の指示追従(です・ます調の維持など)は前世代より改善したという実測観察がある一方、日本語ベンチマークの公式スコアは確認できていません。
  6. 専門ドメインの厳密なフォーマット生成が苦手な場面がある。 計算化学ソフトの入力ファイル生成でキーワード混同や座標の不整合が起きたという検証報告があります。
  7. 公式サポート範囲が狭い。 保証されるのは BF16 と FP8 のみ。GGUF / AWQ / NVFP4 は第三者変換で、品質は自己責任です。

セキュリティ:ローカルなら安全、ではない

ローカルLLM実行でも残るセキュリティリスクのイメージ

ローカルLLMの解説記事の多くが「ローカルだからデータが外に出ず安全」で止まっていますが、実際にはそこで終わりません。メリットとリスクを分けて考える必要があります。

得られるもの:データの外部送信をなくせる

Apache 2.0 + 自己ホストの組み合わせにより、機密データを外部APIに送らずに推論できます。医療・金融・法務など、オンプレミス要件がある領域との相性は良好です。VentureBeat も、プライバシー・情報セキュリティ・ガバナンス・自社データの統制を企業側のメリットとして挙げています。

それでも残る4つのリスク

1. 無検閲化(abliterated)された派生モデルを掴むリスク

これは日本語記事でほとんど扱われていない論点です。「abliteration」とは、モデル内部の「拒否方向」をSVD等で外科的に除去し、再学習なしに安全機構を無効化する手法を指します。Qwen3.8-27B にも公開初日から abliterated 版が出回っています。

ある第三者テストでは、素の Qwen3.8-27B が明確な違法要求を 3件中3件拒否したのに対し、abliterated 版は 3件中0件(=何も拒否しない)という結果が報告されています(サンプル数が極小のテストなので、傾向として読んでください)。能力面でも abliterated 版は MMLU 82.3%(素は84.5%)と若干劣化しています。

つまり、Hugging Face で拾った「Qwen3.8のGGUF」が、安全機構を外した派生である可能性があるということです。企業導入時は、リポジトリの出所確認を必須のチェック項目にしてください。

2. 学習由来のバイアス

ホスト型の中国系アシスタントが政治的に敏感な話題で回答を回避する傾向は複数報告されています。セルフホストすればサービス側の検閲レイヤは外せますが、学習段階で組み込まれたバイアスまでは除去できません。 世論分析・国際政治・歴史的経緯が絡む業務では、出力の偏りを前提にレビュー工程を置くべきです。

3. prefill攻撃への脆弱性

アシスタント応答の冒頭を強制的に注入してガードレールを回避する「prefill攻撃」について、オープンウェイトモデル全般に系統的な脆弱性があることが学術的に指摘されています(arXiv 2602.14689 ほか)。ウェイトを持てるということは、攻撃側も自由に試行できるということです。なお Qwen3.8-27B 単体の安全性スコア(CASI等)は現時点で確認できていません。

4. エージェント権限の設計

OSWorld 84.3/AndroidWorld 81.9 が示すのは、このモデルがPCやスマートフォンを実際に操作できるということです。ファイル書き込み・ネットワークアクセス・シェル実行の権限を無制限に与えれば、ローカルLLMであっても被害は発生します。サンドボックス化と最小権限の原則は必須です。この観点は AIエージェントのセキュリティ対策 で体系的に整理しています。

コード生成用途でのリスク全般は AIコーディングのセキュリティリスク も参考にしてください。日本企業での利用にあたっては、経産省・IPAのガイドラインおよび社内のAI利用規程との整合を各自で確認してください。

他のローカルLLMとの棲み分け

オープンモデルには複数の選択肢があります。用途に応じた使い分けの目安を整理します。

モデル

ライセンス

特徴

選ぶ場面

Qwen3.8-27B

Apache 2.0

マルチモーダル/262K/エージェント特化

画像も扱いたい、PC操作を自動化したい、商用配布したい

Gemma 4 12B

Google独自(比較的緩め)

ノートPCクラスでも動く軽量マルチモーダル

16GB前後のVRAMで手堅く回したい

GLM-5.3-Flash

MIT

320B/18BアクティブMoE。API料金が安い

ローカルよりAPI前提でコストを抑えたい

GLM-5.1

MIT

コーディング性能が高い

ライセンスの自由度を最優先したい

Llama 4 Scout

Meta独自ライセンス

17B active MoE/超長文脈

超長文の処理が主目的

Kimi K2.6

オープンウェイト

1T級MoE

ローカルよりサーバ運用向け

LLM-jp-4 33B

Apache 2.0

国産。日本語性能に強み

日本語のローカル知識が重要な用途

Qwen3.8-27B を選ぶ決め手は3つです。「画像・動画を入力に使う」「エージェントとしてPC/ブラウザ操作をさせる」「Apache 2.0で派生モデルを商用配布したい」。このいずれも当てはまらないなら、他モデルのほうが素直な選択肢になることもあります。

日本語特有の知識が精度上クリティカルな業務では、国産LLM 7選の比較 も併せて検討してください。

こんな人におすすめ

  • 社外にデータを出せない企業の開発・情シス担当者:Apache 2.0+自己ホストで、機密文書やコードを外部送信せずに処理できる
  • VRAM 24GB以上の自前GPUを持つ開発者:4bit量子化で常用可能。トークン課金を気にせずエージェントを長時間回せる
  • RTX 5090(32GB)を持っている、または購入を検討している人:NVFP4構成で150〜200 tok/s の報告があり、128Kの文脈も現実的。費用対効果が最も高い層
  • 画像・図表・スキャン文書を扱う業務:OmniDocBench 91.1(公式発表値)が示すとおり文書解析に強い
  • PC操作の自動化を試したい人:OSWorldで84.3。オープンモデルとしてはトップクラスの操作能力
  • モデルを自社仕様に育てたい企業:LoRAファインチューニング済みの派生モデルを商用配布できる
  • モデルのバージョン固定が必要な業務:クラウド側の予告なきモデル更新の影響を受けない

おすすめしない人

  • VRAM 16GB未満の環境しかない人:1〜2bit量子化なら起動しますが品質劣化が大きく、エージェント用途には使えません。素直にAPIかクラウドサービスを選ぶべきです
  • コスト削減だけが目的の個人・小規模チーム:月間1億トークン規模を使わない限り、OpenRouter 経由($0.22/$2.42)のほうが安く収まります
  • 最高難度のコーディングタスクを任せたい人:DeepSWE 1.1 で 42.2(GPT-5.6は72.7)。フロンティアモデルとの差は明確です
  • 音声入出力が必要な人:非対応。Omni系モデルを検討してください
  • 128K超の長文を常用したいがVRAMが32GB未満の人:256Kを積むと実測34GB必要です。ローカルでは現実的ではありません
  • 日本語のローカル知識が精度上クリティカルな業務:ハルシネーション報告があり、RAGでの補強か国産LLMとの併用が必要です
  • 中国系モデルの利用が社内規程で制限されている組織:ウェイトを自社管理していても、規程上の判断は別問題です
  • サーバ運用の担当者を置けない組織:量子化選定・KVキャッシュ調整・エンジンのバージョン管理には継続的な工数がかかります

よくある質問

Q. 「Qwen3.8」と「Qwen3.8-27B」は同じものですか。
A. 違います。「Qwen3.8」はシリーズ名で、その中に 27B(Apache 2.0・マルチモーダル)、2.4T-A95B(独自ライセンス・テキストのみ)、Max(ホスト型API)、Flash-Next(Qwen4の先行プレビュー)があります。ローカル実行の文脈で「Qwen3.8」と呼ばれているのは、ほぼ 27B のことです。

Q. Qwen3.8-27B を商用製品に組み込んで販売できますか。
A. 27B は Apache 2.0 なので、現時点の公式モデルカードに基づけば可能です。ただし帰属表示とライセンス条文の同梱が必要です。同名シリーズの Qwen3.8-2.4T-A95B は別ライセンスなので、組み込むモデル名を必ず特定してください。

Q. RTX 4090(24GB)で「快適に」動きますか。
A. 4bit量子化で 4Kなら46 tok/s、64Kでも38 tok/s という実測があり、64Kまでなら常用できます。128K以上を積むと24GBでは足りません(実測26GB)。まずQ4系GGUFで自分のワークロードを流し、生成速度と残メモリを実測してから判断してください。

Q. なぜ「262K」と「1M」の2つの数字が出てくるのですか。
A. 262,144トークンがネイティブの学習・設計上の上限で、100万トークンはYaRNという外挿手法を設定して拡張した場合の上限です。後者は精度・速度のトレードオフを伴うため、同列に扱えません。

Q. Unsloth の 6.2GB 版(1bit)を業務で使っても大丈夫ですか。
A. おすすめしません。Unsloth 自身が、1bit版はエージェント用途に不適だと明記しています。top-1%精度は約72%維持されるとされますが、複数トークン先の予測精度が急落し、設定を誤ると空出力になります。試用や検証には使えますが、業務フローに組み込むなら最低でも4bitを選んでください。

Q. Cerebras の1,500 tok/s は本当にお得ですか。
A. 速度は圧倒的ですが、コスト効率では OpenRouter に劣ります。あるユーザーの報告では同じタスクで Cerebras $1.60/5.1分、OpenRouter 約$0.29/14.4分でした。加えて有料でも128K上限、プロンプトキャッシュの読み出しも同額です。待ち時間そのものが価値になる対話・エージェント用途に絞って使うのが合理的です。

Q. Hugging Face の量子化版はどれを選べばいいですか。
A. 業務利用なら、公式リポジトリ(Qwen/Qwen3.8-27BQwen/Qwen3.8-27B-FP8)、Ollama 公式ライブラリ、または Unsloth のように実績のあるアップローダに限定してください。安全機構を外した abliterated 版が混在しているため、素性の不明なリポジトリからウェイトを引くのは、素性の不明なバイナリを実行するのと同じリスクを持ちます。

Q. 企業で導入する際、最初に確認すべきことは何ですか。
A. 順に3つです。①どのモデル名を使うのか(ライセンスがモデル単位で違うため)、②扱うデータの機密区分とオンプレ要件、③エージェント機能を使う場合の権限設計とサンドボックス。この3点を先に固めてからGPU選定に進むと、手戻りが起きにくくなります。

まとめ

Qwen3.8-27B(Qwen 3.8 27B)は、オープンウェイトのローカルLLMで、マルチモーダルとエージェント操作を実用域に乗せたという点で節目になるモデルです。Apache 2.0 で商用利用でき、262Kのネイティブ文脈を持ち、4bit量子化すれば24GBのGPU 1枚で常用できます。公開から3週間で Hugging Face 5.7M ダウンロード、Artificial Analysis の集計でオープンウェイト1位という評価も得ています。

一方で、押さえておくべき前提もあります。「17GBのファイルだから17GBで足りる」は誤りで、64Kで22GB、128Kで26GB、256Kで34GBが実測値です。Apache 2.0 なのは 27B だけで、シリーズの他モデルは条件が違います。そして「ローカルだから安全」でもありません。無検閲化された派生モデル、prefill攻撃、エージェント権限の設計という別種のリスクが残ります。

判断の起点はシンプルです。データを外に出せない事情があるか、VRAM 24GB以上のGPUに投資できるか。 この2つがYesなら、現時点で27Bクラスの有力な選択肢です。Noであれば、OpenRouter 経由($0.22/$2.42)で試すか、Qwen3.8-Max のようなホスト型APIから検討するほうが早く成果が出ます。

関連記事

このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します

業務を1つ送る

この記事の著者

AI革命

AI革命

編集部

AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。

経理・事務作業・開発を、AI革命にまとめて任せられます

ご相談は無料です。オンラインで完結します