Module 5 : Développement de Modèles Larges Hors Ligne

Ce chapitre vous guide à travers l'exécution de Modèles de Langage Larges (LLM) entièrement sur votre appareil Jetson — sans cloud, sans clés API, sans que vos données ne quittent votre matériel. Vous apprendrez les concepts fondamentaux des LLM, puis vous vous exercerez avec trois frameworks d'inférence populaires : Ollama, llama.cpp et vLLM. À la fin, vous aurez construit un assistant vocal entièrement hors ligne qui écoute, réfléchit et parle.

5-banner

Ce Que Vous Apprendrez

  • Fondamentaux des LLM — ce que sont les modèles, comment fonctionne la quantification et ce que signifient vraiment les "tokens"
  • Ollama — déploiement de modèle en une commande pour une expérimentation rapide
  • llama.cpp — inférence légère en C/C++ avec un contrôle fin de la quantification
  • vLLM — service de niveau production avec batch continu et API compatible OpenAI
  • jetson-examples — déployez des démos d'IA pré-construites avec une seule commande
  • Pipeline vocal — combinez ASR + LLM + TTS en un assistant vocal complet hors ligne

Plan du Cours

Parcours d'Apprentissage Suggérés

Choisissez un parcours selon votre objectif :

Démarrage Rapide — Faites fonctionner un modèle aujourd'hui

  1. 5.1 — Introduction aux LLM — construisez le modèle mental
  2. 5.2 — Premiers Pas avec Ollama — premier chat en deux commandes
  3. 5.5 — Démarrage Rapide Jetson Examples — explorez les démos pré-construites

Approfondissement des Frameworks — Comparez les moteurs d'inférence

  1. 5.1 — Introduction aux LLM
  2. 5.2 — Ollama — configuration facile
  3. 5.3 — llama.cpp — léger et personnalisable
  4. 5.4 — vLLM — service haute performance

Assistant Vocal — Construisez quelque chose qui parle

  1. 5.1 — Introduction aux LLM
  2. 5.2 — Ollama ou 5.5 — jetson-examples — faites fonctionner un modèle
  3. 5.6 — Pipeline ASR + LLM + TTS — assemblez la boucle vocale complète

Matériel et Prérequis

Matériel Minimum

ComposantMinimumRecommandé
AppareilJetson Orin Nano 8GBJetson Orin NX 16GB Super
Stockage64 Go libres128 Go+ SSD
Swap8 Go16 Go+ pour les modèles plus grands

Avant de Commencer

  1. Chapitre 2 — Vue d'Ensemble de la Plateforme reComputer Jetson
  2. Chapitre 3 — Outils de Base et Premiers Pas
  3. Docker installé et configuré (pour les exemples conteneurisés)
  4. Familiarité basique avec le terminal Linux

Choisir la Taille de Modèle Appropriée

Pas sûr du modèle qui convient à votre appareil ? Commencez ici :

Taille du ModèleRAM NécessaireFonctionne surVitesse Typique
1–3B4–6 GoOrin Nano 4 Go+Rapide, interactif
7–8B8–12 GoOrin Nano 8 Go+Modéré, pratique
13–14B16–24 GoOrin NX 16 Go+Plus lent, qualité supérieure
35B+48 Go+Non recommandé pour un seul appareilTrès lent

Conseil : Commencez petit (3B) pour apprendre le flux de travail, puis montez en taille quand vous êtes à l'aise.

Termes Clés

TermeCe Que Ça Signifie
LLMModèle de Langage Large — un réseau neuronal entraîné sur des données textuelles massives pour comprendre et générer du langage
InférenceExécuter un modèle entraîné pour produire des sorties à partir de nouvelles entrées
QuantificationCompresser les poids du modèle (ex. 16-bit → 4-bit) pour utiliser moins de mémoire
Fenêtre de ContexteLe nombre maximum de tokens qu'un modèle peut considérer à la fois
TokenUn morceau de texte (mot, sous-mot ou caractère) que le modèle traite
GGUFUn format de fichier pour stocker des modèles quantifiés, optimisé pour llama.cpp
ASRReconnaissance Automatique de la Parole — parole vers texte
TTSSynthèse Vocale — texte vers audio parlé

Références

  • jetson-examples — Demos d'IA pré-construits pour Jetson
  • Ollama — Exécuteur de LLM local
  • llama.cpp — Moteur d'inférence C/C++
  • vLLM — Service LLM haute performance

Prêt à commencer ? Plongez dans le Module 5.1 : Introduction aux Modèles de Langage Larges pour comprendre les fondamentaux, ou allez directement au Module 5.2 : Premiers Pas avec Ollama si vous voulez exécuter votre premier modèle immédiatement.