Module 5 : Développement de Modèles Larges Hors Ligne
Ce chapitre vous guide à travers l'exécution de Modèles de Langage Larges (LLM) entièrement sur votre appareil Jetson — sans cloud, sans clés API, sans que vos données ne quittent votre matériel. Vous apprendrez les concepts fondamentaux des LLM, puis vous vous exercerez avec trois frameworks d'inférence populaires : Ollama, llama.cpp et vLLM. À la fin, vous aurez construit un assistant vocal entièrement hors ligne qui écoute, réfléchit et parle.

Ce Que Vous Apprendrez
- Fondamentaux des LLM — ce que sont les modèles, comment fonctionne la quantification et ce que signifient vraiment les "tokens"
- Ollama — déploiement de modèle en une commande pour une expérimentation rapide
- llama.cpp — inférence légère en C/C++ avec un contrôle fin de la quantification
- vLLM — service de niveau production avec batch continu et API compatible OpenAI
- jetson-examples — déployez des démos d'IA pré-construites avec une seule commande
- Pipeline vocal — combinez ASR + LLM + TTS en un assistant vocal complet hors ligne
Plan du Cours
| Module | Sujet | Difficulté |
|---|---|---|
| 5.1 | Introduction aux Modèles de Langage Larges | Débutant |
| 5.2 | Premiers Pas avec Ollama | Débutant |
| 5.3 | Exécuter des LLM avec llama.cpp | Intermédiaire |
| 5.4 | Inférence Haute Performance avec vLLM | Avancé |
| 5.5 | Démarrage Rapide Jetson Examples | Débutant |
| 5.6 | Construire un Pipeline ASR + LLM + TTS | Intermédiaire |
Parcours d'Apprentissage Suggérés
Choisissez un parcours selon votre objectif :
Démarrage Rapide — Faites fonctionner un modèle aujourd'hui
- 5.1 — Introduction aux LLM — construisez le modèle mental
- 5.2 — Premiers Pas avec Ollama — premier chat en deux commandes
- 5.5 — Démarrage Rapide Jetson Examples — explorez les démos pré-construites
Approfondissement des Frameworks — Comparez les moteurs d'inférence
- 5.1 — Introduction aux LLM
- 5.2 — Ollama — configuration facile
- 5.3 — llama.cpp — léger et personnalisable
- 5.4 — vLLM — service haute performance
Assistant Vocal — Construisez quelque chose qui parle
- 5.1 — Introduction aux LLM
- 5.2 — Ollama ou 5.5 — jetson-examples — faites fonctionner un modèle
- 5.6 — Pipeline ASR + LLM + TTS — assemblez la boucle vocale complète
Matériel et Prérequis
Matériel Minimum
| Composant | Minimum | Recommandé |
|---|---|---|
| Appareil | Jetson Orin Nano 8GB | Jetson Orin NX 16GB Super |
| Stockage | 64 Go libres | 128 Go+ SSD |
| Swap | 8 Go | 16 Go+ pour les modèles plus grands |
Avant de Commencer
- Chapitre 2 — Vue d'Ensemble de la Plateforme reComputer Jetson
- Chapitre 3 — Outils de Base et Premiers Pas
- Docker installé et configuré (pour les exemples conteneurisés)
- Familiarité basique avec le terminal Linux
Choisir la Taille de Modèle Appropriée
Pas sûr du modèle qui convient à votre appareil ? Commencez ici :
| Taille du Modèle | RAM Nécessaire | Fonctionne sur | Vitesse Typique |
|---|---|---|---|
| 1–3B | 4–6 Go | Orin Nano 4 Go+ | Rapide, interactif |
| 7–8B | 8–12 Go | Orin Nano 8 Go+ | Modéré, pratique |
| 13–14B | 16–24 Go | Orin NX 16 Go+ | Plus lent, qualité supérieure |
| 35B+ | 48 Go+ | Non recommandé pour un seul appareil | Très lent |
Conseil : Commencez petit (3B) pour apprendre le flux de travail, puis montez en taille quand vous êtes à l'aise.
Termes Clés
| Terme | Ce Que Ça Signifie |
|---|---|
| LLM | Modèle de Langage Large — un réseau neuronal entraîné sur des données textuelles massives pour comprendre et générer du langage |
| Inférence | Exécuter un modèle entraîné pour produire des sorties à partir de nouvelles entrées |
| Quantification | Compresser les poids du modèle (ex. 16-bit → 4-bit) pour utiliser moins de mémoire |
| Fenêtre de Contexte | Le nombre maximum de tokens qu'un modèle peut considérer à la fois |
| Token | Un morceau de texte (mot, sous-mot ou caractère) que le modèle traite |
| GGUF | Un format de fichier pour stocker des modèles quantifiés, optimisé pour llama.cpp |
| ASR | Reconnaissance Automatique de la Parole — parole vers texte |
| TTS | Synthèse Vocale — texte vers audio parlé |
Références
- jetson-examples — Demos d'IA pré-construits pour Jetson
- Ollama — Exécuteur de LLM local
- llama.cpp — Moteur d'inférence C/C++
- vLLM — Service LLM haute performance
Prêt à commencer ? Plongez dans le Module 5.1 : Introduction aux Modèles de Langage Larges pour comprendre les fondamentaux, ou allez directement au Module 5.2 : Premiers Pas avec Ollama si vous voulez exécuter votre premier modèle immédiatement.