Fine-tuning vs RAG: Quando Usar Cada Abordagem
O Dilema do Conhecimento Especializado
Você precisa que um LLM "saiba" sobre seu domínio específico (leis estaduais, protocolos médicos, documentação interna). Duas opções:
- Fine-tuning: Treinar o modelo com seus dados
- RAG: Buscar informações em tempo real e injetar no prompt
Qual escolher? Depende.
Caso 1: MeAssessoraAI (Jurídico) → RAG
O Problema
Assessores jurídicos precisam citar leis específicas e jurisprudência atualizada.
Por que RAG?
✅ Atualização constante: Novas leis surgem mensalmente ✅ Citação precisa: Precisamos do número exato da lei (RAG retorna fonte) ✅ Custo: Fine-tuning custaria $500-2000, RAG custa $30/mês (embeddings + vector DB) ✅ Transparência: Conseguimos mostrar ao usuário DE ONDE veio a informação
Implementação
Base de 15.000 documentos legais → Embeddings → Qdrant
Quando usuário pergunta sobre licitações:
- Busca top 5 documentos relevantes (RAG)
- Injeta no contexto do GPT-4o
- Modelo responde baseado nos documentos
- Interface mostra as fontes clicáveis
Resultado: 94% de precisão em citações legais.
Caso 2: Classificação de Tickets (Cliente Interno) → Fine-tuning
O Problema
Empresa de telecomunicações recebia 10k tickets/dia e precisava categorizar em 47 categorias específicas.
Por que Fine-tuning?
✅ Sem necessidade de busca externa: Categorias são fixas ✅ Latência crítica: Fine-tuned GPT-3.5 responde em 0.3s vs RAG em 2s ✅ Padrões complexos: Categorias dependem de jargão interno (RAG não captura nuances) ✅ ROI: Com 10k requests/dia, fine-tuning se paga em 2 semanas
Implementação
Dataset: 50.000 tickets históricos categorizados manualmente
# Fine-tuning OpenAI
from openai import OpenAI
client = OpenAI()
client.fine_tuning.jobs.create(
training_file="file-abc123",
model="gpt-3.5-turbo",
hyperparameters={"n_epochs": 3}
)
Resultado:
- Acurácia de 89% (vs 71% com zero-shot)
- Latência de 0.3s (vs 2.1s com RAG)
- Custo: $2.40/mês por 1M tokens (vs $20 com GPT-4o zero-shot)
Caso 3: OgmaVox (Médico) → Híbrido
O Problema
Transcrição médica precisa entender jargão técnico E buscar protocolos atualizados.
Solução: Fine-tuning + RAG
- Fine-tuning (Whisper): Treinamos Whisper com 200h de áudio médico para melhorar transcrição de termos técnicos ("hipertireoidismo", "hemoglobina glicada")
- RAG (GPT-4o): Busca protocolos médicos em tempo real para validar informações
Quando Usar Híbrido?
✅ Parte do conhecimento é estático (jargão, padrões de comunicação) ✅ Parte é dinâmica (guidelines atualizados, novas pesquisas)
Resultado:
- WER (Word Error Rate) de transcrição: 8.2% → 3.1%
- Custo de fine-tuning: $180 (one-time)
- ROI: Break-even em 3 meses
Matriz de Decisão
| Critério | RAG | Fine-tuning | |----------|-----|-------------| | Dados mudam frequentemente | ✅ Sim | ❌ Não | | Precisa citar fontes | ✅ Sim | ❌ Não | | Latência crítica (< 500ms) | ❌ Não | ✅ Sim | | Volume alto (> 1M requests/mês) | ❌ Depende | ✅ Sim | | Budget limitado (< $500) | ✅ Sim | ⚠️ Depende | | Padrões complexos de linguagem | ❌ Não | ✅ Sim |
Custos Comparados (100k requests/mês)
RAG
- Embeddings: $10
- Vector DB (Qdrant self-hosted): $20
- LLM calls (context maior): $300
- Total: ~$330/mês
Fine-tuning
- Treinamento inicial: $500 (one-time)
- Inferência: $50/mês (modelo menor, contexto menor)
- Total: $550 (primeiro mês), $50/mês depois
Break-even: 2 meses
Erros Comuns
❌ Fine-tunar sem dados suficientes: Precisa de pelo menos 500 exemplos de qualidade ❌ RAG sem reranking: Top results do vector search nem sempre são os melhores ❌ Não testar híbrido: Muitas vezes a melhor solução é combinar ambos
Ferramentas Recomendadas
Fine-tuning
- OpenAI Fine-tuning API: Mais fácil, mas menos controle
- Axolotl + LoRA: Self-hosted, flexível
- Hugging Face AutoTrain: Middle-ground
RAG
- LangChain: Orchestration framework
- LlamaIndex: Especializado em RAG
- Qdrant/Pinecone: Vector databases
Conclusão
Não existe "melhor abordagem". Analise:
- Frequência de atualização dos dados
- Necessidade de citação de fontes
- Budget e volume de requisições
- Requisitos de latência
Na Sagrexia, 70% dos nossos projetos usam RAG porque os dados mudam constantemente. Mas quando fine-tuning faz sentido, o ROI é indiscutível.
Gostou deste artigo?
Vamos conversar sobre como podemos aplicar essas técnicas no seu projeto. Nossa equipe está pronta para transformar sua visão em realidade.