模块 5:离线大模型开发

本章将带你学习如何在 Jetson 设备上完全离线运行大语言模型(LLM)——无需云服务、无需 API 密钥、数据不会离开你的硬件。你将了解 LLM 的核心概念,然后亲自动手体验三个流行的推理框架:Ollamallama.cppvLLM。学完本章后,你将构建一个完整的离线语音助手,能够聆听、思考并语音回复。

5-banner

你将学到什么

  • LLM 基础 — 模型是什么、量化如何工作、"token"到底是什么
  • Ollama — 一条命令部署模型,快速实验
  • llama.cpp — 轻量级 C/C++ 推理,对量化进行细粒度控制
  • vLLM — 生产级服务,支持连续批处理和 OpenAI 兼容 API
  • jetson-examples — 一条命令部署预构建 AI 演示
  • 语音流水线 — 将 ASR + LLM + TTS 结合成完整的离线语音助手

课程大纲

推荐学习路径

根据你的目标选择路径:

快速上手 — 今天就让模型跑起来

  1. 5.1 — 大语言模型简介 — 建立概念模型
  2. 5.2 — Ollama 快速入门 — 两行命令完成首次对话
  3. 5.5 — Jetson Examples 快速入门 — 探索预构建演示

框架深入学习 — 对比推理引擎

  1. 5.1 — 大语言模型简介
  2. 5.2 — Ollama — 轻松上手
  3. 5.3 — llama.cpp — 轻量且可定制
  4. 5.4 — vLLM — 高吞吐服务

语音助手 — 构建会对话的应用

  1. 5.1 — 大语言模型简介
  2. 5.2 — Ollama5.5 — jetson-examples — 让模型跑起来
  3. 5.6 — ASR + LLM + TTS 流水线 — 组装完整语音交互

硬件与前置要求

最低硬件要求

组件最低配置推荐配置
设备Jetson Orin Nano 8GBJetson Orin NX 16GB Super
存储64 GB 可用空间128 GB+ SSD
Swap8 GB16 GB+(运行更大模型时)

开始之前

  1. 第 2 章 — reComputer Jetson 平台概述
  2. 第 3 章 — 基础工具与入门
  3. Docker 已安装并配置(用于容器化示例)
  4. 具备 Linux 终端基本操作能力

选择合适的模型大小

不确定哪个模型适合你的设备?从这里开始:

模型大小所需内存适用设备典型速度
1–3B4–6 GBOrin Nano 4 GB+快,交互流畅
7–8B8–12 GBOrin Nano 8 GB+中等,实用的选择
13–14B16–24 GBOrin NX 16 GB+较慢,质量更高
35B+48 GB+不推荐单机运行很慢

提示: 先从小模型(3B)开始学习流程,熟悉后再升级。

关键术语

术语含义
LLM大语言模型 — 在海量文本数据上训练用于理解和生成语言的神经网络
Inference推理 — 运行训练好的模型对新输入产生输出
Quantization量化 — 压缩模型权重(如从 16 位压缩到 4 位)以减少内存占用
Context Window上下文窗口 — 模型一次能处理的最多 token 数
Token词元 — 模型处理的文本片段(词、子词或字符)
GGUF一种存储量化模型的格式,为 llama.cpp 优化
ASR自动语音识别 — 语音转文字
TTS文本转语音 — 文字转语音

参考资料


准备好了吗? 开始学习 模块 5.1:大语言模型简介 了解基础概念,或者直接进入 模块 5.2:Ollama 快速入门 立刻运行你的第一个模型。