モジュール 5: オフライン大規模モデル開発

この章では、Jetson デバイス上で大言語モデル(LLM)を完全にオフラインで実行する方法を説明します。クラウド、API キー、データの外部送信が一切不要です。LLM のコアコンセプトを学んだ後、3つの人気推論フレームワーク Ollamallama.cppvLLM を実際に体験します。最後には、聞いて、考えて、話す完全なオフライン音声アシスタントを構築できるようになります。

5-banner

学習内容

  • LLM の基礎 — モデル是什么、量子化の仕組み、「トークン」の本当の意味
  • Ollama — ワンコマンドでモデルデプロイ、素早く実験可能
  • llama.cpp — 軽量な C/C++ 推論、量子化をきめ細かく制御
  • vLLM — 本番グレードのサービング、継続的バッチ処理と OpenAI 互換 API
  • jetson-examples — 単一コマンドで AI デモをデプロイ
  • 音声パイプライン — ASR + LLM + TTS を組み合わせた完全なオフライン音声アシスタント

コース大纲

推奨学習パス

目標に合ったパスを選んでください:

クイックスタート — 今日からモデルを実行

  1. 5.1 — 大言語モデル概述 — メンタルモデルを構築
  2. 5.2 — Ollama 入門 — 2つのコマンドで最初のチャット
  3. 5.5 — Jetson Examples クイックスタート — 프리构建デモを探索

フレームワーク深掘り — 推論エンジンの比較

  1. 5.1 — 大言語モデル概述
  2. 5.2 — Ollama — 簡単セットアップ
  3. 5.3 — llama.cpp — 軽量でカスタマイズ可能
  4. 5.4 — vLLM — 高スループットサービング

音声アシスタント — 話してり返すアプリを作る

  1. 5.1 — 大言語モデル概述
  2. 5.2 — Ollama または 5.5 — jetson-examples — モデルを実行
  3. 5.6 — ASR + LLM + TTS パイプライン — 完全な音声ループを組み立て

ハードウェアと前提条件

最小ハードウェア

コンポーネント最小推奨
デバイスJetson Orin Nano 8GBJetson Orin NX 16GB Super
ストレージ64 GB 空き128 GB+ SSD
Swap8 GB16 GB+( larger models 用)

始める前に

  1. 第 2 章 — reComputer Jetson プラットフォーム概述
  2. 第 3 章 — 基本的ツールと始め方
  3. Docker のインストールと設定済み(コンテナ例用)
  4. Linux ターミナル基本知識

モデルサイズの選び方

どのモデルがデバイスに合うか分からない?ここから始めましょう:

モデルサイズ必要な RAM動作デバイス典型的な速度
1–3B4–6 GBOrin Nano 4 GB+高速、インタラクティブ
7–8B8–12 GBOrin Nano 8 GB+中程度、実用的
13–14B16–24 GBOrin NX 16 GB+低速、高品質
35B+48 GB+单机非推奨非常に低速

ヒント: 最初は小さいモデル(3B)から始めて、ワークフローに慣れたらスケールアップしましょう。

重要な用語

用語意味
LLM大言語モデル — 言語を理解・生成するために大量のテキストデータで訓練されたニューラルネットワーク
推論(Inference)訓練済みモデルを実行して新しい入力から出力を生成すること
量子化(Quantization)メモリ削減のためにモデル重み(例:16ビット → 4ビット)を圧縮すること
コンテキストウィンドウモデルが一回で処理できるトークンの最大数
トークンモデルが処理するテキストのチャンク(単語、サブワード、文字)
GGUFllama.cpp 用に最適化された量子化モデル保存用ファイル形式
ASR自動音声認識 — 音声からテキストへ
TTSテキスト読み上げ — テキストから音声へ

参考文献

  • jetson-examples — Jetson 用の프리构建 AI デモ
  • Ollama — ローカル LLM ランナー
  • llama.cpp — C/C++ 推論エンジン
  • vLLM — 高スループット LLM サービング

始める準備はできましたか? モジュール 5.1:大言語モデル概述 で基礎概念を学ぶか、すぐに最初のモデルを実行したい場合は モジュール 5.2:Ollama 入門 に進んでください。