For the complete documentation index, see llms.txt. This page is also available as Markdown.

Gemma 4 - ローカルでの実行方法

E2B、E4B、26B A4B、31B を含む Google の新しい Gemma 4 モデルをローカルで実行しましょう。

Gemma 4は、以下を含むGoogle DeepMindの新しいオープンモデル群です 12B, E2B, E4B, 26B-A4B31B。 マルチモーダルなハイブリッド思考モデルは140以上の言語に対応し、最大 256K コンテキスト、DenseおよびMoEのバリアントがあります。Gemma 4はApache-2.0ライセンスで提供され、ローカルデバイスで実行できます。

Gemma-4-12B は新しく、テキスト、画像、音声を統合してサポートします。以下で動作します 8GB RAM(4ビット)または14GB(8ビット)。 Gemma-4-E2BE4B も画像と音声をサポートします。以下で実行できます 5GB RAM (4ビット)または15GB(完全な16ビット)。GGUF、MLX、NVFP4量子化を介して利用できます。

Gemma 4を実行Gemma 4をファインチューニングGemma 4 QATGemma 4 MTP

Gemma-4-26B-A4B は以下で動作します 18GB (4ビット)または28GB(8ビット)。 Gemma-4-31B には 20GB RAM (4ビット)または34GB(8ビット)。

すべてのGGUF、 MLX を実行し、Gemma 4をファインチューニングできるようになりました Unsloth (右を参照)。

QAT バリアント のGemma 4は、モデル品質を維持しながらメモリ要件を約3分の1に削減します。

Image

使用ガイド

Gemma 4は、推論、コーディング、ツール使用、長大なコンテキスト、エージェント型ワークフロー、マルチモーダルタスクに優れています。より小さなE2BおよびE4BバリアントはスマートフォンとノートPC向けに設計され、より大きなモデルはNVIDIA RTX GPU搭載PCなど、中~高性能のCPU / VRAMシステムを対象としています。

Gemma 4バリアント
詳細
最適な用途

E2B

Dense + PLE(128Kコンテキスト) 対応:テキスト、画像、音声

スマートフォン/エッジ推論、ASR、音声翻訳向け

E4B

Dense + PLE(128Kコンテキスト) 対応:テキスト、画像、音声

ノートPCおよび高速なローカルマルチモーダル利用向けの小型モデル

12B Unified

Dense(256Kコンテキスト) 対応:テキスト、画像、音声

ノートPCおよびローカルマルチモーダル利用向けの中型モデル

26B-A4B

MoE(256Kコンテキスト) 対応:テキスト、画像

コンピュータ利用に最適な速度/品質のトレードオフ

31B

Dense(256Kコンテキスト) 対応:テキスト、画像

遅めの推論で最高の性能

Gemma 4を見る: 性能ベンチマークGGUFベンチマーク.

26B-A4Bと31Bのどちらを選ぶべきですか?

  • 26B-A4B - 速度と精度のバランスを取ります。MoE設計により、アクティブパラメータが4Bで、31Bより高速です。RAMが限られており、速度のために品質を少し犠牲にしてもよい場合に選択してください。

  • 31B - 現在最も強力なGemma 4モデルです。十分なメモリがあり、やや遅い速度を許容できる場合に、最高品質のために選択してください。

ハードウェア要件

表:Gemma 4推論GGUFの推奨ハードウェア要件 (単位=合計メモリ:RAM + VRAM、またはユニファイドメモリ)。MacOS、NVIDIA RTX GPUなどでGemma 4を使用できます。

Gemma 4バリアント
4ビット
8ビット
BF16 / FP16

E2B

4 GB

5~8 GB

10 GB

E4B

5.5~6 GB

9~12 GB

16 GB

12B Unified

7~8 GB

13~14 GB

25 GB

26B A4B

16~18 GB

28~30 GB

52 GB

31B

17~20 GB

34~38 GB

62 GB

目安として、利用可能な合計メモリは、ダウンロードする量子化モデルのサイズを少なくとも上回る必要があります。上回らない場合でも、llama.cppは部分的なRAM/ディスクオフロードを使用して実行できますが、生成は遅くなります。使用するコンテキストウィンドウに応じて、より多くの計算リソースも必要になります。

推奨設定

GoogleのデフォルトのGemma 4パラメータを使用することを推奨します:

  • temperature = 1.0

  • top_p = 0.95

  • top_k = 64

Gemma 4の最大コンテキストは 128K (対象: E2B / E4B262,144 (対象: 12B / 26B A4B / 31B.

思考モード

古いGemmaチャットテンプレートと比較して、Gemma 4は標準の system, assistantuser ロールを使用し、明示的な思考制御を追加しています。

思考を有効にする方法:

トークン <|think|>システムプロンプトの先頭.

思考が有効

思考が無効

出力の挙動:

思考が有効な場合、モデルは最終回答の前に内部推論チャネルを出力します。

思考が無効な場合でも、大型モデルは最終回答の前に 空のthoughtブロック を出力することがあります。

たとえば、「フランスの首都は何ですか?」の場合:

次のように出力されます:

マルチターンチャットのルール:

マルチターン会話では、 チャット履歴には最後に表示された回答のみを残してください。 しないで ください。以前のthoughtブロックを次のターンに再入力してはいけません。

思考を無効にする方法:

注記 llama-cli は確実に動作しない可能性があるため、 llama-server を使用して推論を無効にしてください:

Gemma 4チュートリアルを実行

Gemma 4 GGUFには複数のサイズがあるため、小型モデルでは8ビット、大型モデルでは以下を開始点として推奨します ダイナミック 4ビット. Gemma 4 GGUF または MLX または NVFP4:

🦥 Unsloth Studio ガイド🦙 Llama.cppガイド

当社の以下のUI付きノートブックで、Gemma 4を無料で実行およびトレーニングできます: Unsloth ノートブック:

Unsloth ガイド

Gemma 4はMacOS、Windows、LinuxのUnslothで実行およびファインチューニングできます。以下が可能です:

Image

Unsloth をダウンロード

https://unsloth.ai/download

1

Gemma 4を検索してダウンロード

その後、 Unsloth Chat タブでGemma 4を検索バーから検索し、希望するモデルと量子化をダウンロードします。Unslothは最新のGemma-4-12B Unifiedモデルをサポートしています。

Image
2

Gemma 4を実行

Image

🦙 Llama.cppガイド

このガイドでは、12B、26B-A4B、31BにはDynamic 4ビットを、E2BとE4Bには8ビットを使用します。参照: Gemma 4 GGUFコレクション

これらのチュートリアルでは、 llama.cpp 高速なローカル推論に使用します。特に CPU を使う場合に適しています。

1

最新のものを入手 llama.cpp GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON-DGGML_CUDA=OFF GPU がない場合、または CPU 推論だけを使いたい場合。 Apple Mac / Metal デバイスでは-DGGML_CUDA=OFF を設定して、そのまま続けてください。Metal サポートはデフォルトで有効です。

2

もし llama.cpp を直接使用してモデルをロードする場合、各モデルに応じて以下のコマンドに従ってください。 UD-Q4_K_XL は量子化タイプです。Hugging Face経由でもダウンロードできます(ステップ3)。これは以下と似ています ollama run に似ています。 export LLAMA_CACHE=\"folder\" を強制するために llama.cpp を使用して特定の場所に保存します。llama.cppが必要な正確な量を自動的に使用するため、コンテキスト長を設定する必要はありません。

12B:

26B-A4B:

31B:

E4B:

E2B:

3

モデルも、以下のコードで手動ダウンロードできます( pip install huggingface_hub)。選ぶことができます UD-Q4_K_XL または次のような他の量子化版も Q8_0 。ダウンロードが停止する場合は、以下を参照してください: Hugging Face Hub、XETのデバッグ

4

次に、会話モードでモデルを実行します(visionあり mmproj-F16):

5

Llama-serverデプロイメント

llama-serverでGemma-4をデプロイするには、以下を使用します:

MLX Dynamic Quants

MacOSデバイス向けの最初の試みとして、動的4ビットおよび8ビット量子化もアップロードしました!MLX量子化は visionをサポートします。

Gemma 4
4ビットMLX
8ビットMLX

試すには次を使用してください:

NVFP4ガイド

アップロードしました Dynamic NVFP4 NVIDIA Blackwell GPUでより高速な4ビット推論を実現するGemma 4量子化を提供しています。Gemma 4を含め、使用できるモデルのハードウェア要件は以下のとおりです。また、達成できる全体的な速度向上もご覧ください:

Gemma 4バリアント
必要なVRAM
BF16より高速

7 GB

1.12倍高速

9 GB

1.22倍高速

11 GB

1.26倍高速

26 GB

1.41倍高速

32 GB

1.45倍高速

Image

vLLMチュートリアル:

NVFP4量子化を実行するには、以下のGemma-4-26B-A4Bを実行するコマンドを参照してください vLLMSGLang (モデル名を gemma-4-31B-it-NVFP4 など)。また、MoEバックエンドは絶対に選択せず、vLLMに選択させてください。たとえばMarlinは2.5倍遅くなります!参照: Gemma 4DGX Sparkをお持ちなら、 Gemma 4 必ず --moe-backend flashinfer_b12x を参照してください。さもないと、推論がかなり遅くなります。

別のvenvにvLLMをインストールするには:

次に、26B MoEバリアントを提供するには:

変更してください unsloth/gemma-4-26B-A4B-it-NVFP4 を任意の 利用可能なNVFP4 量子化名に変更してください!

MTP / speculative decoding(デコードは速いが、スループットはやや低下)を有効にするには、次を使用してください:

Torchcodecの問題が出た場合は、必ず以下を実行してからvllmを再起動してください。

NVFP4量子化版でのDGX Spark

DGX Sparkで正しいカーネルを使うことを確認するために(さもないと 推論が2倍遅くなります)、まず以下を確認してください:

エラーにならないはずです。もしエラーになるなら、vLLMを更新するか、以下で再インストールしてください:

その後、DGX SparkでvLLMで提供するには:

Torchcodecの問題が出た場合は、必ず以下を実行してからvllmを再起動してください。

SGLangチュートリアル:

Ollamaガイド

Ollamaは現在、Unsloth GGUFを適切にサポートしています。以下を使用してください curl -fsSL https://ollama.com/install.sh | sh LinuxにOllamaをインストールするには、または irm https://ollama.com/install.ps1 | iex をWindowsで使用します。 単一の量子化ファイル(50GB未満)を使用するには:

より大きなBF16シャードのような複数シャードの場合は、次を実行してください:

Image

次の表示が出た場合: Error: 500 Internal Server Error: unable to load model 以下でOllamaを更新するか、 curl -fsSL https://ollama.com/install.sh | sh またはPowerShell版を使用してください。

Gemma 4のベストプラクティス

プロンプト例

シンプルな推論プロンプト

OCR/文書プロンプト

OCRには、 大きなビジュアルトークン予算 を使用します。例: 560 または 1120.

マルチモーダル比較プロンプト

音声ASRプロンプト

音声翻訳プロンプト

マルチモーダル設定

マルチモーダルプロンプトで最良の結果を得るには、マルチモーダルコンテンツを先に配置してください:

  • 配置する テキストより前に画像および/または音声を配置.

  • 動画の場合は、先にフレームのシーケンスを渡し、その後に指示を渡してください。

音声と動画の制限

  • 音声 は以下で利用可能です 12B, E2BE4B のみ。

  • 音声は最大 30秒.

  • 動画は最大 60秒 をサポートします( 1秒あたり1フレーム の処理を想定)。

音声プロンプトテンプレート

ASRプロンプト

音声翻訳プロンプト

📊 ベンチマーク

Unsloth GGUF ベンチマーク

最適な量子化を選ぶため、プロバイダー全体でGemma 4 GGUFの平均KLダイバージェンス・ベンチマークを実施しました(低いほど良好)。

  • KLダイバージェンスにより、すべてのUnsloth GGUFがSOTAパレートフロンティア上に位置付けられます

  • KLDは、量子化モデルが元のBF16出力分布にどれだけよく一致しているかを示し、保持された精度を示します。

Image
26B A4B - KLDベンチマーク(低いほど良好)

公式Gemmaベンチマーク

テキスト/コードベンチマーク

ベンチマーク
Gemma 4 31B
Gemma 4 26B A4B
Gemma 4 12B Unified
Gemma 4 E4B
Gemma 4 E2B
Gemma 3 27B(思考なし)

MMLU Pro

85.2%

82.6%

77.2%

69.4%

60.0%

67.6%

AIME 2026(ツールなし)

89.2%

88.3%

77.5%

42.5%

37.5%

20.8%

LiveCodeBench v6

80.0%

77.1%

72.0%

52.0%

44.0%

29.1%

Codeforces ELO

2150

1718

1659

940

633

110

GPQA Diamond

84.3%

82.3%

78.8%

58.6%

43.4%

42.4%

Tau2

76.9%

68.2%

69.0%

42.2%

24.5%

16.2%

HLE(ツールなし)

19.5%

8.7%

5.2%

-

-

-

HLE(検索あり)

26.5%

17.2%

-

-

-

-

BigBench Extra Hard

74.4%

64.8%

53.0%

33.1%

21.9%

19.3%

MMMLU

88.4%

86.3%

83.4%

76.6%

67.4%

70.7%

視覚ベンチマーク

MMMU Pro

76.9%

73.8%

69.1%

52.6%

44.2%

49.7%

OmniDocBench 1.5(低いほど良好)

0.131

0.149

0.164

0.181

0.290

0.365

MATH-Vision

85.6%

82.4%

79.7%

59.5%

52.4%

46.0%

MedXPertQA MM

61.3%

58.1%

48.7%

28.7%

23.5%

-

音声ベンチマーク

CoVoST

-

-

38.5*

35.54

33.47

-

FLEURS(低いほど良い)

-

-

0.069*

0.08

0.09

-

長文コンテキスト

MRCR v2 8 needle 128k(平均)

66.4%

44.1%

43.4%

25.4%

19.1%

13.5%

Image

最終更新

役に立ちましたか?