En bref

Le RAG (Retrieval-Augmented Generation) indexe vos documents en vecteurs et injecte les passages pertinents dans le prompt au moment de la requête. Le fine-tuning ré-entraîne le modèle sur des exemples pour lui apprendre un style, un format de sortie ou un type de raisonnement. Le RAG couvre la connaissance, le fine-tuning la forme.

RAG et fine-tuning sont les deux façons principales d'injecter de la connaissance spécifique dans un LLM. On les oppose souvent — à tort. Elles répondent à des besoins différents et se combinent très bien.

Règle simple : RAG pour ce que le modèle doit savoir, fine-tuning pour comment le modèle doit parler ou raisonner. Commencez toujours par RAG ; passez au fine-tuning quand vous avez épuisé le RAG.

RAG (Retrieval-Augmented Generation)

Vous indexez vos documents en vecteurs (pgvector, Pinecone, Qdrant), et au moment d'une requête, vous récupérez les passages pertinents et les injectez dans le prompt du modèle. Le modèle répond à partir de ce contexte.

  • Idéal pour : support client, docs internes, base de connaissances évolutive
  • Coût : embeddings (0,02 € pour 10 k tokens) + recherche vectorielle + tokens de contexte
  • Force : vos données restent chez vous, mise à jour immédiate

Fine-tuning

Vous entraînez le modèle sur des exemples de dialogue ou de format spécifique. Le modèle apprend un style, un format de sortie ou un type de raisonnement.

  • Idéal pour : réponses au format contraint (JSON strict), ton de marque, tâches répétitives
  • Coût : entraînement 20 à 200 € + inférence 1,5 à 3 × plus chère qu'un modèle de base
  • Force : qualité et latence supérieures sur la tâche entraînée

Comment trancher en 3 questions

  1. Vos données changent souvent ? → RAG.
  2. Vous voulez un ton ou format très spécifique ? → fine-tuning.
  3. Les deux ? → RAG d'abord, fine-tuning ensuite si vous n'atteignez pas la qualité voulue.
Le fine-tuning apprend au modèle à parler comme vous. Le RAG apprend au modèle ce que vous savez. Ne confondez pas les deux.

On regarde votre projet IA ?

En 30 minutes je peux vous dire si votre besoin appelle du RAG, du fine-tuning, ou juste un bon prompt. Réservez un appel. À lire aussi : Intégrer OpenAI dans son SaaS.

Questions fréquentes

RAG ou fine-tuning : lequel choisir ?

RAG si vos données changent souvent : support client, documentation interne, base de connaissances évolutive. Fine-tuning si vous voulez un ton ou un format de sortie très spécifique. Les deux se combinent : RAG d'abord, fine-tuning ensuite si la qualité visée n'est pas atteinte.

Combien coûte une architecture RAG ?

Le coût se répartit entre les embeddings (environ 0,02 € pour 10 000 tokens), la recherche vectorielle (pgvector, Pinecone ou Qdrant) et les tokens de contexte ajoutés à chaque requête. Vos données restent chez vous et la mise à jour est immédiate.

Combien coûte un fine-tuning de LLM ?

Entre 20 et 200 € d'entraînement, puis une inférence 1,5 à 3 fois plus chère qu'un modèle de base. En contrepartie, la qualité et la latence sont supérieures sur la tâche précise pour laquelle le modèle a été entraîné.

Un projet à lancer ou à sauver ?

30 min d'appel gratuit. On regarde ensemble ce qui bloque et par où commencer.

Réserver un appel découverte