模块 5:离线大模型开发
本章将带你学习如何在 Jetson 设备上完全离线运行大语言模型(LLM)——无需云服务、无需 API 密钥、数据不会离开你的硬件。你将了解 LLM 的核心概念,然后亲自动手体验三个流行的推理框架:Ollama、llama.cpp 和 vLLM。学完本章后,你将构建一个完整的离线语音助手,能够聆听、思考并语音回复。

你将学到什么
- LLM 基础 — 模型是什么、量化如何工作、"token"到底是什么
- Ollama — 一条命令部署模型,快速实验
- llama.cpp — 轻量级 C/C++ 推理,对量化进行细粒度控制
- vLLM — 生产级服务,支持连续批处理和 OpenAI 兼容 API
- jetson-examples — 一条命令部署预构建 AI 演示
- 语音流水线 — 将 ASR + LLM + TTS 结合成完整的离线语音助手
课程大纲
| 模块 | 主题 | 难度 |
|---|---|---|
| 5.1 | 大语言模型简介 | 入门 |
| 5.2 | Ollama 快速入门 | 入门 |
| 5.3 | 使用 llama.cpp 运行 LLM | 进阶 |
| 5.4 | vLLM 高性能推理 | 高级 |
| 5.5 | Jetson Examples 快速入门 | 入门 |
| 5.6 | 构建 ASR + LLM + TTS 流水线 | 进阶 |
推荐学习路径
根据你的目标选择路径:
快速上手 — 今天就让模型跑起来
- 5.1 — 大语言模型简介 — 建立概念模型
- 5.2 — Ollama 快速入门 — 两行命令完成首次对话
- 5.5 — Jetson Examples 快速入门 — 探索预构建演示
框架深入学习 — 对比推理引擎
- 5.1 — 大语言模型简介
- 5.2 — Ollama — 轻松上手
- 5.3 — llama.cpp — 轻量且可定制
- 5.4 — vLLM — 高吞吐服务
语音助手 — 构建会对话的应用
- 5.1 — 大语言模型简介
- 5.2 — Ollama 或 5.5 — jetson-examples — 让模型跑起来
- 5.6 — ASR + LLM + TTS 流水线 — 组装完整语音交互
硬件与前置要求
最低硬件要求
| 组件 | 最低配置 | 推荐配置 |
|---|---|---|
| 设备 | Jetson Orin Nano 8GB | Jetson Orin NX 16GB Super |
| 存储 | 64 GB 可用空间 | 128 GB+ SSD |
| Swap | 8 GB | 16 GB+(运行更大模型时) |
开始之前
- 第 2 章 — reComputer Jetson 平台概述
- 第 3 章 — 基础工具与入门
- Docker 已安装并配置(用于容器化示例)
- 具备 Linux 终端基本操作能力
选择合适的模型大小
不确定哪个模型适合你的设备?从这里开始:
| 模型大小 | 所需内存 | 适用设备 | 典型速度 |
|---|---|---|---|
| 1–3B | 4–6 GB | Orin Nano 4 GB+ | 快,交互流畅 |
| 7–8B | 8–12 GB | Orin Nano 8 GB+ | 中等,实用的选择 |
| 13–14B | 16–24 GB | Orin NX 16 GB+ | 较慢,质量更高 |
| 35B+ | 48 GB+ | 不推荐单机运行 | 很慢 |
提示: 先从小模型(3B)开始学习流程,熟悉后再升级。
关键术语
| 术语 | 含义 |
|---|---|
| LLM | 大语言模型 — 在海量文本数据上训练用于理解和生成语言的神经网络 |
| Inference | 推理 — 运行训练好的模型对新输入产生输出 |
| Quantization | 量化 — 压缩模型权重(如从 16 位压缩到 4 位)以减少内存占用 |
| Context Window | 上下文窗口 — 模型一次能处理的最多 token 数 |
| Token | 词元 — 模型处理的文本片段(词、子词或字符) |
| GGUF | 一种存储量化模型的格式,为 llama.cpp 优化 |
| ASR | 自动语音识别 — 语音转文字 |
| TTS | 文本转语音 — 文字转语音 |
参考资料
- jetson-examples — Jetson 预构建 AI 演示
- Ollama — 本地 LLM 运行器
- llama.cpp — C/C++ 推理引擎
- vLLM — 高吞吐量 LLM 服务
准备好了吗? 开始学习 模块 5.1:大语言模型简介 了解基础概念,或者直接进入 模块 5.2:Ollama 快速入门 立刻运行你的第一个模型。