Fine-tuningRAGML StrategyCase Study

Fine-tuning vs RAG: Quando Usar Cada Abordagem

João Oliveira 2025-11-20 11 min

O Dilema do Conhecimento Especializado

Você precisa que um LLM "saiba" sobre seu domínio específico (leis estaduais, protocolos médicos, documentação interna). Duas opções:

  1. Fine-tuning: Treinar o modelo com seus dados
  2. RAG: Buscar informações em tempo real e injetar no prompt

Qual escolher? Depende.

Caso 1: MeAssessoraAI (Jurídico) → RAG

O Problema

Assessores jurídicos precisam citar leis específicas e jurisprudência atualizada.

Por que RAG?

Atualização constante: Novas leis surgem mensalmente ✅ Citação precisa: Precisamos do número exato da lei (RAG retorna fonte) ✅ Custo: Fine-tuning custaria $500-2000, RAG custa $30/mês (embeddings + vector DB) ✅ Transparência: Conseguimos mostrar ao usuário DE ONDE veio a informação

Implementação

Base de 15.000 documentos legais → Embeddings → Qdrant

Quando usuário pergunta sobre licitações:

  1. Busca top 5 documentos relevantes (RAG)
  2. Injeta no contexto do GPT-4o
  3. Modelo responde baseado nos documentos
  4. Interface mostra as fontes clicáveis

Resultado: 94% de precisão em citações legais.

Caso 2: Classificação de Tickets (Cliente Interno) → Fine-tuning

O Problema

Empresa de telecomunicações recebia 10k tickets/dia e precisava categorizar em 47 categorias específicas.

Por que Fine-tuning?

Sem necessidade de busca externa: Categorias são fixas ✅ Latência crítica: Fine-tuned GPT-3.5 responde em 0.3s vs RAG em 2s ✅ Padrões complexos: Categorias dependem de jargão interno (RAG não captura nuances) ✅ ROI: Com 10k requests/dia, fine-tuning se paga em 2 semanas

Implementação

Dataset: 50.000 tickets históricos categorizados manualmente

# Fine-tuning OpenAI
from openai import OpenAI

client = OpenAI()
client.fine_tuning.jobs.create(
    training_file="file-abc123",
    model="gpt-3.5-turbo",
    hyperparameters={"n_epochs": 3}
)

Resultado:

  • Acurácia de 89% (vs 71% com zero-shot)
  • Latência de 0.3s (vs 2.1s com RAG)
  • Custo: $2.40/mês por 1M tokens (vs $20 com GPT-4o zero-shot)

Caso 3: OgmaVox (Médico) → Híbrido

O Problema

Transcrição médica precisa entender jargão técnico E buscar protocolos atualizados.

Solução: Fine-tuning + RAG

  1. Fine-tuning (Whisper): Treinamos Whisper com 200h de áudio médico para melhorar transcrição de termos técnicos ("hipertireoidismo", "hemoglobina glicada")
  2. RAG (GPT-4o): Busca protocolos médicos em tempo real para validar informações

Quando Usar Híbrido?

Parte do conhecimento é estático (jargão, padrões de comunicação) ✅ Parte é dinâmica (guidelines atualizados, novas pesquisas)

Resultado:

  • WER (Word Error Rate) de transcrição: 8.2% → 3.1%
  • Custo de fine-tuning: $180 (one-time)
  • ROI: Break-even em 3 meses

Matriz de Decisão

| Critério | RAG | Fine-tuning | |----------|-----|-------------| | Dados mudam frequentemente | ✅ Sim | ❌ Não | | Precisa citar fontes | ✅ Sim | ❌ Não | | Latência crítica (< 500ms) | ❌ Não | ✅ Sim | | Volume alto (> 1M requests/mês) | ❌ Depende | ✅ Sim | | Budget limitado (< $500) | ✅ Sim | ⚠️ Depende | | Padrões complexos de linguagem | ❌ Não | ✅ Sim |

Custos Comparados (100k requests/mês)

RAG

  • Embeddings: $10
  • Vector DB (Qdrant self-hosted): $20
  • LLM calls (context maior): $300
  • Total: ~$330/mês

Fine-tuning

  • Treinamento inicial: $500 (one-time)
  • Inferência: $50/mês (modelo menor, contexto menor)
  • Total: $550 (primeiro mês), $50/mês depois

Break-even: 2 meses

Erros Comuns

Fine-tunar sem dados suficientes: Precisa de pelo menos 500 exemplos de qualidade ❌ RAG sem reranking: Top results do vector search nem sempre são os melhores ❌ Não testar híbrido: Muitas vezes a melhor solução é combinar ambos

Ferramentas Recomendadas

Fine-tuning

  • OpenAI Fine-tuning API: Mais fácil, mas menos controle
  • Axolotl + LoRA: Self-hosted, flexível
  • Hugging Face AutoTrain: Middle-ground

RAG

  • LangChain: Orchestration framework
  • LlamaIndex: Especializado em RAG
  • Qdrant/Pinecone: Vector databases

Conclusão

Não existe "melhor abordagem". Analise:

  1. Frequência de atualização dos dados
  2. Necessidade de citação de fontes
  3. Budget e volume de requisições
  4. Requisitos de latência

Na Sagrexia, 70% dos nossos projetos usam RAG porque os dados mudam constantemente. Mas quando fine-tuning faz sentido, o ROI é indiscutível.

Compartilhar artigo:

Gostou deste artigo?

Vamos conversar sobre como podemos aplicar essas técnicas no seu projeto. Nossa equipe está pronta para transformar sua visão em realidade.

Ver Mais Artigos