Inkling-Smallとは|Thinking Machinesの軽量オープンウェイトモデル・276B/12Bで本家Inkling超え・1Mコンテキストと使い方・Inklingとの違い【2026年10月最新】

この記事のポイント
Inkling-SmallはThinking Machines Labが2026年7月30日に公開した総276B・アクティブ12BのMoE型オープンウェイトモデルです。本家Inklingを上回るベンチと下回るベンチ、Tinker料金(割引前後)、必要GPU、使い方3パターン、Inklingとの使い分けを公式情報をもとに整理します。
Inkling-Small(インクリング・スモール)は、Thinking Machines Labが2026年7月30日(米国時間)に公開した、総パラメータ276B・アクティブ12BのMoE型オープンウェイトモデルです。 本家Inklingの約1/4のサイズで、コーディングや推論のベンチマークでは本家を上回ります。一方で知識量・事実性は本家より明確に弱く、動かすには量子化しても約180GBのGPUメモリが必要です。
仕様・ベンチマーク・Tinkerの料金(2026年10月時点の割引価格と通常価格)・必要なGPU・使い方・Inklingとの選び分けを、公式発表・モデルカード・Tinker公式ドキュメントをもとに整理しました。オープンウェイトのLLMを自社サービスやエージェントに組み込みたい開発者、コストを抑えながら高性能なモデルを探している企業のAI導入担当者に向けた内容です。

出典: Thinking Machines Lab 公式サイト
Inkling-Smallとは?本家の1/4サイズで同等性能をねらった軽量版

出典: Thinking Machines Lab - Inkling-Small 発表記事
Inkling-Smallは、「Inklingの約1/4のサイズで、ほぼ同じ性能」を公式にうたう軽量版モデルです。ライセンスはApache 2.0で、商用利用・改変・再配布ができます。
開発元のThinking Machines Lab(TML)は、元OpenAI CTOのMira Murati氏が創業したAI企業です。2026年7月15日に同社初の基盤モデル「Inkling」を公開し、その時点ではInkling-Smallを「プレビュー・重み公開予定」として予告していました。約2週間後の7月30日に、全重みがHugging Faceで公開されています。
項目 | 内容 |
|---|---|
モデル名 | Inkling-Small |
開発元 | Thinking Machines Lab(米国) |
公開日 | 2026年7月30日(米国時間)/日本では7月31日に報道 |
ライセンス | Apache 2.0(商用利用・改変・再配布OK) |
総パラメータ | 276B(2,760億) |
アクティブパラメータ | 12B(120億)/トークン |
コンテキスト長 | 最大1Mトークン(公式)。提供先によって64K・256Kなどに制限あり |
入力 | テキスト・画像・音声 |
出力 | テキストのみ |
配布先 | Hugging Face |
知識カットオフ | 未公表 |
開発元の成り立ちや資金調達の経緯は「Thinking Machines Labとは」、上位モデルの詳細は「Thinking Machines Inklingとは」で解説しています。
「276B/12B」の意味:計算は軽いが、メモリは重い
Inkling-SmallはMoE(Mixture of Experts)という構造を採用しています。モデルの中に256個の「専門家(エキスパート)」があり、1トークンを処理するたびにそのうち6個と共有専門家2個だけが動く仕組みです。
- 総パラメータ276B: モデル全体の大きさ。GPUメモリにはこの全量を載せる必要がある
- アクティブ12B: 1トークンあたり実際に計算に使う量。推論速度やコストに効く
つまり「アクティブ12B」は計算量が12Bクラスで済むという意味で、12Bクラスのモデルのように軽いPCで動くという意味ではありません。名前に「Small」とあるため誤解されやすい点です。
技術仕様の要点
項目 | Inkling-Small | Inkling(参考) |
|---|---|---|
総/アクティブパラメータ | 276B/12B | 975B/41B |
構成 | 42層のデコーダのみTransformer + 疎なMoE(専門家256個から6個 + 共有2個) | 同系統のMoE |
アテンション | ローカル層とグローバル層のハイブリッド | スライディングウィンドウ:グローバル = 5:1 |
コンテキスト | 最大1Mトークン | 最大1Mトークン |
マルチモーダル | エンコーダを持たないネイティブ方式(画像は40×40パッチ、音声はdMelスペクトログラム) | 同じ |
思考量の調整 | minimal〜xhigh | none〜max |
学習方法 | 事前学習レシピの見直し + Inklingを教師にしたon-policy蒸留(一部)+ エージェント型コーディングRLを追加 | — |
小さいモデルが一部で本家を上回った理由について、公式は事前学習のデータ配分の見直し、Inklingからの蒸留、エージェント型コーディング向け強化学習を2週間追加でスケールしたことを挙げています。
Inkling-Smallでできること
Inkling-Smallは、コーディングエージェントやツール連携型のシステムに組み込む用途で特に力を発揮するモデルです。公式が想定する主な用途は次のとおりです。
- エージェント・ツール利用: 関数呼び出しに対応。OpenRouterでもtools・reasoningのパラメータに対応している
- コーディング支援: SWE-bench Verified 80.2%、Terminal-Bench 2.1 64.7%と、本家を上回るスコア
- 画像・音声の理解: テキスト・画像・音声をひとつのモデルでまとめて推論できる(画像は40〜4096px、音声は16kHz WAVで2分未満が推奨)
- 長文処理: 公式では最大1Mトークン。大きなコードベースや長いドキュメントをまとめて渡せる
- RAG・チャットボット: 社内文書検索と組み合わせた回答システム
- 思考量の調整: minimal〜xhighの範囲で「速さ・安さ」と「品質」のバランスをタスクごとに選べる
- ファインチューニング: 公式サービスのTinkerでLoRA(PEFT)による追加学習ができる
エージェント型のAI活用の全体像を知りたい場合は「AIエージェントとは」もあわせて読むと位置づけがつかみやすくなります。
できないこと・弱み
Inkling-Smallの最大の弱みは事実性(知識を正確に答える力)です。事実を問うQAベンチマークのSimpleQA Verifiedでは20.6%と、本家Inkling(43.9%)の半分以下にとどまります。
- 画像・音声の生成はできない: 出力はテキストのみ
- 知識を問う質問に弱い: 固有名詞・数値・時事の正確さが求められる用途では、RAG(検索結果を渡す仕組み)で補う前提になる
- 個人PCではほぼ動かない: 量子化しても約180GBのGPUメモリが必要
- コンテキスト長は提供先しだい: 公式は最大1Mだが、Tinkerでは64K/256K、サーバーレス推論は256K
- 日本語性能は公式評価なし: モデルカードは「英語中心で多言語にも一般的に対応、言語ごとに性能差あり」という記載にとどまる
- 一般的なLLMの限界: ハルシネーション、指示に従わないケース、長いマルチターンでの性能低下(モデルカード記載)
- 高リスク領域での直接利用は対象外: 医療・法務・安全に関わる判断に、追加のファインチューニングと人の監督なしで使うことは想定外とされている
ベンチマーク:本家Inklingに勝つ分野・負ける分野
公式発表のベンチマークでは、推論・コーディング・指示追従ではInkling-Smallが上、数学・音声・事実性ではInklingが上という結果です。タイトルの「本家超え」は一部のベンチマークでの話で、すべての面で上回るわけではありません。
ベンチマーク | 測るもの | Inkling-Small | Inkling | 優位 |
|---|---|---|---|---|
Humanity's Last Exam(テキスト) | 高難度の総合推論 | 31.6% | 29.7% | Small |
SWE-bench Verified | 実務的なコード修正 | 80.2% | 77.6% | Small |
SWE-bench Pro | より難しいコード修正 | 55.9% | — | — |
Terminal-Bench 2.1 | ターミナル操作エージェント | 64.7% | 63.8% | Small |
GDPval-AA v2(Elo) | 実務タスク | 1269 | 1238 | Small |
GPQA Diamond | 大学院レベルの科学 | 89.5% | 87.2% | Small |
IFBench | 指示追従 | 82.2% | 79.8% | Small |
MMMU Pro | 画像を含む推論 | 74.0% | 73.5% | Small |
AIME 2026 | 数学 | 95.5% | 97.1% | Inkling |
Audio MC | 音声理解 | 54.9% | 56.6% | Inkling |
SimpleQA Verified | 事実性 | 20.6% | 43.9% | Inkling(大差) |
AA Omniscience Index | 知識の正確さ | -9.0 | 2.1 | Inkling |
τ³-Banking | 業務エージェント(銀行) | 15.5% | 23.7% | Inkling |
StrongREJECT | 有害要求の拒否 | 98.4% | 98.6% | ほぼ同じ |
※τ³-BankingはVentureBeatの報道による数値。それ以外は公式発表値。
報道ベースでは、Artificial AnalysisのIntelligence Indexでも公開時点でInklingとほぼ同じスコアと紹介されました(指数のバージョン更新で数値は変わるため、最新値は同サイトで確認してください)。また、公式発表の比較ではQwen3.5 397B-A17B、MiniMax M2.7、DeepSeek V4 Flashといった、より大きなオープンウェイトモデルと同等以上の結果が示されています。
この結果から見えるのは、Inkling-Smallが「考えて手を動かす」タスクに強く、「覚えている知識を正確に出す」タスクに弱いという性格です。コード修正やツール操作には向く一方、知識をそのまま答えさせるFAQボットには不向きといえます。
Inkling-Smallの料金:重みは無料、Tinkerは従量課金
モデルの重みはApache 2.0で無料ダウンロードできます。 費用がかかるのは、公式のTinkerやサードパーティのAPIを使う場合と、自前でGPUを用意する場合です。

出典: Thinking Machines Lab - Announcing Tinker
Tinker(学習・推論)の料金:2026年10月6日時点
単位はUSD/100万トークンです。現時点では期間限定の50%オフが適用されています(終了日は公式未発表)。
モデル・コンテキスト | Prefill(入力) | キャッシュ済みPrefill | Sample(出力) | Train(学習) | 通常価格(Prefill/Sample/Train) |
|---|---|---|---|---|---|
Inkling-Small 64K | $0.58 | $0.116 | $1.44 | $1.73 | $1.16/$2.88/$3.46 |
Inkling-Small 256K | $1.16 | $0.232 | $2.89 | $3.47 | $2.32/$5.78/$6.94 |
Inkling 64K(参考) | $1.87 | $0.374 | $4.68 | $5.61 | $3.74/$9.36/$11.22 |
Inkling 256K(参考) | $3.74 | $0.748 | $9.36 | $11.23 | $7.48/$18.72/$22.46 |
Tinkerサーバーレス推論(ベータ・256Kコンテキスト)
モデル | Prefill(入力) | キャッシュ済み | Sample(出力) |
|---|---|---|---|
Inkling-Small | $0.30 | $0.06 | $1.20 |
Inkling(参考) | $1.00 | $0.17 | $4.05 |
推論だけ使うなら、サーバーレスの入力$0.30/出力$1.20(100万トークンあたり)が基準になります。出力単価はInklingの約30%です。参考までに、同じTinkerの料金表ではGPT-OSS-120B(32K)がPrefill $0.33/Sample $0.84となっており、Inkling-Smallはオープンウェイトの中でも手頃な価格帯にあります。
サードパーティでの提供状況
提供先 | 状況(2026年10月6日時点) |
|---|---|
OpenRouter |
|
Together AI | モデルページはあるが「Launching soon」表示。一般提供は未確認 |
Artificial Analysis(計測サイト) | 入力$0.30/出力$1.20、出力速度は約205トークン/秒と計測(時期により変動) |
複数モデルをひとつのAPIで切り替えたい場合は「OpenRouterとは」が参考になります。料金は変わりやすいため、利用前にTinker公式ドキュメントで最新価格を確認してください。
必要なGPU:「Small」でも個人PCでは動かない

出典: Hugging Face - thinkingmachines/Inkling-Small
Inkling-Smallを自分で動かすには、量子化版でも約180GBのGPUメモリが必要です。 ゲーミングPCや一般的なMacのワークステーション1台では動きません。
形式 | 必要VRAMの目安 | GPU構成の例 |
|---|---|---|
BF16(フル精度) | 600GB以上 | NVIDIA B300×4 または H200×8 |
NVFP4(量子化) | 約180GB | NVIDIA B300×1 または H200×2 |
本家Inklingは量子化版でも約600GBが目安なので、Inkling-Smallは「データセンター向けGPU 1〜2枚で動かせるようになった」という意味での軽量化です。Red Hatが量子化版(RedHatAI/Inkling-Small)をHugging Faceで公開していますが、詳細な仕様は同リポジトリで確認してください。
手元のPCでLLMを動かしたい場合は、Inkling-Smallよりも小さいモデルを選ぶのが現実的です。ローカル実行の基本は「Ollamaとは」で解説しています。
Inkling-Smallの使い方:3つのパターン
Inkling-Smallの利用方法は、①Playgroundで試す、②APIで使う、③重みをダウンロードして自前ホストするの3つです。GPUを持っていないなら①か②から始めるのが無難です。

出典: Thinking Machines Lab - Inkling 公式ページ
① Tinker Playgroundで試す(GPU不要)
TML公式のPlaygroundでは、テキスト・画像・音声を使ったチャットを試せます。まず日本語の出力品質や、自分の業務タスクでの精度を確かめたい人向けです。利用条件(無料枠の有無など)は変わることがあるため、公式ページで確認してください。
② APIで使う(Tinker/OpenRouter)
アプリやエージェントに組み込むなら、APIでの利用が手軽です。
- Tinker: サーバーレス推論(ベータ)またはモデル指定(
thinkingmachines/Inkling-Small、256K版はthinkingmachines/Inkling-Small:peft:262144)で利用。LoRAによるファインチューニングも同じ基盤で行える - OpenRouter:
thinkingmachines/inkling-smallを指定。ほかのモデルと切り替えながら試したい場合に便利
③ Hugging Faceから重みを取得して自前ホスト
データを外部に出したくない企業や、推論基盤を自社で持つチーム向けです。Hugging Faceのモデルカードには、次のコマンドが記載されています。
# vLLM
pip install vllm
vllm serve "thinkingmachines/Inkling-Small"
# SGLang
pip install sglang
python3 -m sglang.launch_server --model-path "thinkingmachines/Inkling-Small"
# Transformers
pip install -U transformers accelerate
# AutoProcessor と AutoModelForMultimodalLM で読み込む公開時点でvLLM・SGLang・Transformersに対応しており、報道ではTokenSpeedやUnslothのサポートも伝えられています。自前ホストでは、入出力のガードレール、ログ管理、ツール実行権限の制限を利用者側で用意する必要があります。
立場別のおすすめの始め方
立場 | おすすめの方法 | 費用感 |
|---|---|---|
まず性能を確かめたい個人・担当者 | Tinker Playground | 公式の利用条件による |
アプリ・エージェントに組み込みたい開発者 | Tinkerサーバーレス推論 or OpenRouter | 入力$0.30/出力$1.20(Tinker・100万トークン) |
自社データで調整したい企業 | TinkerでLoRAファインチューニング | Train $1.73〜(割引中・64K) |
データを外に出せない企業 | NVFP4で自前ホスト | GPU約180GB分(H200×2など)の設備 |
Inklingとの違いとどちらを選ぶかの基準

出典: Thinking Machines Lab - Introducing Inkling
コーディング・エージェント用途とコスト重視ならInkling-Small、知識の正確さが重要な用途ならInklingが基本の選び分けです。
比較項目 | Inkling-Small | Inkling |
|---|---|---|
サイズ | 276B/12B | 975B/41B |
公開日 | 2026年7月30日 | 2026年7月15日 |
コーディング(SWE-bench Verified) | 80.2% | 77.6% |
推論(HLE) | 31.6% | 29.7% |
数学(AIME 2026) | 95.5% | 97.1% |
事実性(SimpleQA Verified) | 20.6% | 43.9% |
必要VRAM(量子化版) | 約180GB | 約600GB |
Tinkerサーバーレス出力単価 | $1.20 | $4.05 |
思考量の調整 | minimal〜xhigh | none〜max |
ライセンス | Apache 2.0 | Apache 2.0 |
用途別の選び分け
やりたいこと | おすすめ | 理由 |
|---|---|---|
コーディングエージェント・コード修正 | Inkling-Small | SWE-bench・Terminal-Benchで本家を上回る |
ツール連携の自動化(汎用) | Inkling-Small | 指示追従・推論が強く、単価も安い |
業務特化型エージェント(金融など) | Inkling(検証推奨) | τ³-Bankingでは本家が上 |
知識をそのまま答えるQA・FAQボット | Inkling | 事実性のスコアに約2倍の差 |
RAGで根拠文書を渡すQA | Inkling-Small | 知識の弱さを検索結果で補える。コストも低い |
数学・音声理解が中心 | Inkling | わずかに本家が上 |
自前ホストのコストを抑えたい | Inkling-Small | 必要VRAMが約1/3 |
他のオープンウェイトモデルとの位置づけ
Inkling-Smallは、米国企業製・Apache 2.0・画像と音声の入力に対応・アクティブ12Bという組み合わせが特徴です。公式発表で比較対象とされたのは中国勢の大きめのモデルで、それらと同等以上の結果を、より少ないアクティブパラメータで出している点がアピールされています。
モデル | 開発元 | 位置づけ |
|---|---|---|
Inkling-Small | Thinking Machines Lab(米国) | 276B/12B。マルチモーダル入力、Apache 2.0 |
DeepSeek V4 Flash | DeepSeek(中国) | 公式比較の対象。低コスト路線の軽量モデル |
Qwen3.5 397B-A17B | Alibaba(中国) | 公式比較の対象。アクティブ17B |
MiniMax M2.7 | MiniMax(中国) | 公式比較の対象。エージェント用途 |
各モデルのスコアは評価条件が異なるため、個別数値を横に並べて単純比較することはできません。競合の詳細は「DeepSeek V4 Flashとは」「MiniMax M2.7とは」「GLM-5.2とは」「Qwen 3.8 Maxとは」で確認できます。
安全性とセキュリティ:オープンウェイト特有のリスクに注意
Inkling-Smallの安全対策は本家Inklingの事後学習を引き継いでおり、有害要求の拒否率(StrongREJECT)は98.4%と本家とほぼ同じです。ただし敵対的な攻撃への耐性(FORTRESS)は71.6%で、本家の78.0%を下回ります。

公式が開示している取り組みは次のとおりです。
- デプロイ前テストと外部4組織によるレッドチームの実施
- 迎合性、有害な操作、CBRN(化学・生物・放射性物質・核)やサイバー領域の知識、制御喪失シナリオの評価
- 敵対的ファインチューニングのテスト
- 段階的な公開(推論API → 監視付きの一般アクセス → オープンウェイト)
TMLは公式ブログ「A Safe Path to Open Weights」で、InklingとInkling-Smallは危険な能力のフロンティアを広げないため、既存のオープンモデルと比べて大きなリスク増にはならないと判断したと説明しています。一方で、オープンウェイトが社会全体のセキュリティに与える影響には「本当の不確実性」があることも認めています。モデルカードでは、有害なロールプレイ要求にときどき応じるという残存リスクも公表されています。
実務で導入する際は、次の点に注意が必要です。
- 安全フィルタは外せてしまう: 重みが公開されているため、第三者がガードレールを弱めるファインチューニングをすることは防げない
- 自前ホストでは安全対策も自前: 入出力のフィルタリング、ログの保存と監査、エージェントに渡すツール権限の最小化を設計する
- API利用時はデータの扱いを確認: TinkerやOpenRouterなど、利用する提供先のデータ取り扱いポリシーを事前に確認する
オープンウェイトをめぐる業界の議論は「Anthropicのオープンウェイトに対する立場」でも整理しています。
Inkling-Smallはこんな人におすすめ/おすすめしない人
こんな人・企業におすすめ
- コーディングエージェントを低コストで動かしたい開発チーム: SWE-bench Verified 80.2%で、出力単価は本家の約30%
- オープンウェイトを自社基盤で運用したい企業: H200×2程度(NVFP4)から動かせ、Apache 2.0で改変・商用利用も自由
- 中国系オープンモデルの採用に社内制約がある組織: 米国企業製の選択肢になる
- RAGと組み合わせた社内QAを作りたい人: 知識の弱さを検索で補えば、推論力と低コストを活かせる
- 自社データでファインチューニングしたい企業: TinkerでLoRA学習がすぐに試せる
おすすめしない人
- 手元のPC1台でローカル実行したい個人: 量子化しても約180GBのGPUメモリが必要
- 知識をそのまま正確に答えさせたい人: 事実性は本家の半分以下。用途によっては本家Inklingやクローズドモデルが適する
- 画像や音声を生成したい人: 出力はテキストのみ
- 日本語性能の裏付けを重視する人: 日本語の公式ベンチマークはない。自社タスクでの検証が前提
- 医療・法務など高リスク領域でそのまま使いたい人: 追加の調整と人の監督なしでの利用は対象外とされている
Inkling-SmallのFAQ
Q. Inkling-Smallは無料で使えますか?
重みのダウンロードはApache 2.0で無料です。ただし動かすには約180GB以上のGPUメモリが必要なため、多くの人は有料のAPI(Tinkerサーバーレスなら入力$0.30/出力$1.20・100万トークンあたり)を使うことになります。OpenRouterには無料版のページもありますが、条件は変わりやすいため公式ページで確認してください。
Q. MacBookやゲーミングPCで動かせますか?
現時点では現実的ではありません。「アクティブ12B」は計算量の話で、メモリには276B分すべてを載せる必要があります。NVFP4量子化版でもH200×2クラスの環境が目安です。
Q. 1Mトークンのコンテキストはどこでも使えますか?
使えません。最大1Mトークンはモデルとしての公式仕様で、Tinkerの学習・推論は64Kと256K、サーバーレス推論は256Kで提供されています。1Mを使いたい場合は、自前ホストでの設定や各提供先の対応状況を確認する必要があります。
Q. 日本語は使えますか?
多言語に一般的に対応していますが、モデルカードは英語中心と記載しており、日本語のベンチマークは公表されていません。日本語での業務利用を考えているなら、Playgroundなどで実際の業務文書を使って試してから判断するのが確実です。
Q. 動画は入力できますか?
学習データには動画も含まれますが、公式に案内されている入力はテキスト・画像・音声です。動画入力に対応しているとは現時点では言えません。
Q. Tinkerの50%オフはいつまでですか?
公式は「期間限定」とのみ記載しており、終了日は発表されていません。コスト試算をするときは、通常価格(64KでPrefill $1.16/Sample $2.88/Train $3.46)でも採算が合うかを確認しておくと安全です。
まとめ:Inkling-Smallは「推論とコーディングに振った実用サイズ」のオープンウェイトモデル
Inkling-Smallは、Thinking Machines Labが本家Inklingの約2週間後に公開した軽量版で、サイズを約1/4に抑えつつ、推論・コーディング・指示追従では本家を上回りました。
- 総276B・アクティブ12BのMoE、Apache 2.0で重みは無料
- SWE-bench Verified 80.2%などコーディング・エージェント系で本家超え、ただし事実性は本家の半分以下
- Tinkerサーバーレスは入力$0.30/出力$1.20(100万トークン)。学習・推論プランは2026年10月時点で期間限定50%オフ
- 個人PCでは動かない。量子化版でも約180GB(H200×2など)が必要
- 自前ホストではガードレールやログ管理を利用者側で用意する必要がある
コーディングエージェントやRAGを低コストで動かしたいなら有力な候補です。一方で、知識の正確さが重要な用途なら本家Inklingも検討してください。両モデルの設計思想やTinkerの詳細は「Thinking Machines Inklingとは」で確認できます。
このツールを自社の毎月の業務に組み込むと何が変わるか、ご提案します
業務を1つ送るこの記事の著者

AI革命
編集部
AI革命株式会社の編集部です。最新のAI技術動向から実践的な導入事例まで、企業のデジタル変革に役立つ情報をお届けしています。豊富な経験と専門知識を活かし、読者の皆様にとって価値のあるコンテンツを制作しています。
最新記事

GoogleがChromeの脆弱性をAIで発見|13年潜んだサンドボックスエスケープとChrome 149/150の1,072件修正、Big Sleep・CodeMenderの仕組みを解説【2026年10月最新】
2026/10/06

工場の生産管理をAIで改善する方法|リードタイム短縮・在庫最適化の実践ステップ【2026年】
2026/06/07

新Siriは有料化される?Tim Cook氏が示唆したiCloud+課金・無料で使える範囲・iOS 27での提供時期【2026年10月最新】
2026/10/06

コンサルティング業界のAI活用事例【2026年10月】最も効く業務・費用相場・国内事例・導入手順
2026/07/05

スクエニがGeminiでゲームQAを自動化|AIが画面を見てコントローラー操作・2027年までにQA7割AI化・東大松尾研との共同研究を解説【2026年10月最新】
2026/10/06

Kimi K3とは?料金・無料で使えるか・Opus 5.5/GPT-6.1 Sol比較とBedrock対応【2026年10月】
2026/07/17


