Jetson
Jetson Orin NX Super 16GB
16GB機・Nanoとは別機体。JetPack6.2/L4T R36.4.3/CUDA12.6、電力モードMAXN_SUPER、ollama0.34.0で実測。Q4_K_Mで14Bクラス(qwen3:14b 7.4/gemma3:12b 8.7 tok/s)まで実用。tops=157はSuperモードのINT8 sparse公称値(dense 78)で、Nano機の67と同じsparse基準。gpt-oss:20b/qwen3:30b-a3bはGPUロードでサーバークラッシュ→CPU/mmapのみ低速稼働。feasibility参照。
スペック
| ベンダー | NVIDIA |
|---|---|
| カテゴリ | Jetson |
| メモリ | 16 GB |
| メモリ帯域 | 102 GB/s |
| AI性能 | 157 TOPS |
| 最大消費電力 | 40 W |
この機材で計測したモデル
- Gemma 3 12B12.2B / Gemma Terms of Use
- Gemma 3 4B4.3B / Gemma Terms of Use
- Llama 3.2 1B Instruct1.2B / Llama 3.2 Community License
- Llama 3.2 3B Instruct3.2B / Llama 3.2 Community License
- Phi-4-mini Instruct3.8B / MIT
- Qwen2.5 Coder 7B Instruct7.6B / Apache-2.0
- Qwen2.5-VL 3B3.75B / Apache-2.0
- Qwen3 14B14.8B / Apache-2.0
- Qwen3 8B8.2B / Apache-2.0
- Qwen3.5 0.8B0.8B / Apache-2.0
- Qwen3.5 2B2.3B / Apache-2.0
全計測データ
| モデル | 量子化 | ランタイム | tok/s | TTFT(ms) | 温度(℃) | 計測日 |
|---|---|---|---|---|---|---|
| Gemma 3 12B | Q4_K_M | ollama 0.34.0 | 8.7 | 400 | 71 | 2026-09-14 |
| Gemma 3 4B | Q4_K_M | ollama 0.34.0 | 19.7 | 151 | 61 | 2026-09-14 |
| Llama 3.2 1B Instruct | Q8_0 | ollama 0.34.0 | 50.3 | 33 | 53 | 2026-09-14 |
| Llama 3.2 3B Instruct | Q4_K_M | ollama 0.34.0 | 24.6 | 64 | 59 | 2026-09-14 |
| Phi-4-mini Instruct | Q4_K_M | ollama 0.34.0 | 21.9 | 69 | 65 | 2026-09-14 |
| Qwen2.5 Coder 7B Instruct | Q4_K_M | ollama 0.34.0 | 13.6 | 97 | 67 | 2026-09-14 |
| Qwen2.5-VL 3B | Q4_K_M | ollama 0.34.0 | 25.7 | 56 | 66 | 2026-09-14 |
| Qwen3 14B | Q4_K_M | ollama 0.34.0 | 7.4 | 163 | 69 | 2026-09-14 |
| Qwen3 8B | Q4_K_M | ollama 0.34.0 | 12.8 | 102 | 70 | 2026-09-14 |
| Qwen3.5 0.8B | Q8_0 | ollama 0.34.0 | 41.6 | 78 | 56 | 2026-09-14 |
| Qwen3.5 2B | Q8_0 | ollama 0.34.0 | 25.1 | 79 | 59 | 2026-09-14 |
※ 数値はすべて自前機材での実測です(ollama API・2回平均・num_predict=256)。
TTFT は同一プロンプトを繰り返す計測でプロンプトキャッシュが効いた状態の値です。機材をまたぐ TTFT の比較は、キャッシュを無効化した再計測(cache-busted-v2)が揃うまで保留しています。
この機材を使った記事
- Jetson Orin NX Super 16GBで14Bはどこまで動くかJetson Orin NX Super 16GBでローカルLLM 11本を実測。8GB Nanoでは載らない12B〜14B(Q4)が実用速度で動くのか、20B超はどうなるかを、decode速度・電力・温度の実測値で確認します。
- ollamaを更新すると速くなる?5機種で実測した答え「ollamaを最新にすると速くなる」は本当か。Jetson・A6000・Mac mini M4・RTX 4060ノート・Raspberry Pi 5の5機種で、旧版0.18.2と新版0.34.0を同一条件で実測。GPU/Metalは4機ともほぼ不変、CPUだけ小幅改善という結果でした。