モジュール 5: オフライン大規模モデル開発
この章では、Jetson デバイス上で大言語モデル(LLM)を完全にオフラインで実行する方法を説明します。クラウド、API キー、データの外部送信が一切不要です。LLM のコアコンセプトを学んだ後、3つの人気推論フレームワーク Ollama、llama.cpp、vLLM を実際に体験します。最後には、聞いて、考えて、話す完全なオフライン音声アシスタントを構築できるようになります。

学習内容
- LLM の基礎 — モデル是什么、量子化の仕組み、「トークン」の本当の意味
- Ollama — ワンコマンドでモデルデプロイ、素早く実験可能
- llama.cpp — 軽量な C/C++ 推論、量子化をきめ細かく制御
- vLLM — 本番グレードのサービング、継続的バッチ処理と OpenAI 互換 API
- jetson-examples — 単一コマンドで AI デモをデプロイ
- 音声パイプライン — ASR + LLM + TTS を組み合わせた完全なオフライン音声アシスタント
コース大纲
| モジュール | トピック | 難易度 |
|---|---|---|
| 5.1 | 大言語モデル概述 | 初心者 |
| 5.2 | Ollama 入門 | 初心者 |
| 5.3 | llama.cpp で LLM を実行 | 中級 |
| 5.4 | vLLM による高性能推論 | 上級 |
| 5.5 | Jetson Examples クイックスタート | 初心者 |
| 5.6 | ASR + LLM + TTS パイプラインの構築 | 中級 |
推奨学習パス
目標に合ったパスを選んでください:
クイックスタート — 今日からモデルを実行
- 5.1 — 大言語モデル概述 — メンタルモデルを構築
- 5.2 — Ollama 入門 — 2つのコマンドで最初のチャット
- 5.5 — Jetson Examples クイックスタート — 프리构建デモを探索
フレームワーク深掘り — 推論エンジンの比較
- 5.1 — 大言語モデル概述
- 5.2 — Ollama — 簡単セットアップ
- 5.3 — llama.cpp — 軽量でカスタマイズ可能
- 5.4 — vLLM — 高スループットサービング
音声アシスタント — 話してり返すアプリを作る
- 5.1 — 大言語モデル概述
- 5.2 — Ollama または 5.5 — jetson-examples — モデルを実行
- 5.6 — ASR + LLM + TTS パイプライン — 完全な音声ループを組み立て
ハードウェアと前提条件
最小ハードウェア
| コンポーネント | 最小 | 推奨 |
|---|---|---|
| デバイス | Jetson Orin Nano 8GB | Jetson Orin NX 16GB Super |
| ストレージ | 64 GB 空き | 128 GB+ SSD |
| Swap | 8 GB | 16 GB+( larger models 用) |
始める前に
- 第 2 章 — reComputer Jetson プラットフォーム概述
- 第 3 章 — 基本的ツールと始め方
- Docker のインストールと設定済み(コンテナ例用)
- Linux ターミナル基本知識
モデルサイズの選び方
どのモデルがデバイスに合うか分からない?ここから始めましょう:
| モデルサイズ | 必要な RAM | 動作デバイス | 典型的な速度 |
|---|---|---|---|
| 1–3B | 4–6 GB | Orin Nano 4 GB+ | 高速、インタラクティブ |
| 7–8B | 8–12 GB | Orin Nano 8 GB+ | 中程度、実用的 |
| 13–14B | 16–24 GB | Orin NX 16 GB+ | 低速、高品質 |
| 35B+ | 48 GB+ | 单机非推奨 | 非常に低速 |
ヒント: 最初は小さいモデル(3B)から始めて、ワークフローに慣れたらスケールアップしましょう。
重要な用語
| 用語 | 意味 |
|---|---|
| LLM | 大言語モデル — 言語を理解・生成するために大量のテキストデータで訓練されたニューラルネットワーク |
| 推論(Inference) | 訓練済みモデルを実行して新しい入力から出力を生成すること |
| 量子化(Quantization) | メモリ削減のためにモデル重み(例:16ビット → 4ビット)を圧縮すること |
| コンテキストウィンドウ | モデルが一回で処理できるトークンの最大数 |
| トークン | モデルが処理するテキストのチャンク(単語、サブワード、文字) |
| GGUF | llama.cpp 用に最適化された量子化モデル保存用ファイル形式 |
| ASR | 自動音声認識 — 音声からテキストへ |
| TTS | テキスト読み上げ — テキストから音声へ |
参考文献
- jetson-examples — Jetson 用の프리构建 AI デモ
- Ollama — ローカル LLM ランナー
- llama.cpp — C/C++ 推論エンジン
- vLLM — 高スループット LLM サービング
始める準備はできましたか? モジュール 5.1:大言語モデル概述 で基礎概念を学ぶか、すぐに最初のモデルを実行したい場合は モジュール 5.2:Ollama 入門 に進んでください。