Aprenda a combinar o poder de modelos grandes com a eficiência de modelos rápidos para criar sistemas de RAG escaláveis e de baixa latência. Ideal para quem busca otimizar aplicações de busca e geração de texto em produção.
Nível: Intermediário a Avançado
Para quem é: Desenvolvedores, engenheiros de ML, arquitetos de sistemas e profissionais de IA que desejam otimizar pipelines de busca e geração de texto
Ao concluir, você será capaz de: Capacitar o aluno a implementar arquiteturas híbridas de RAG, combinando eficiência de modelos rápidos com a precisão de modelos grandes para aplicações em produção
8 módulos · 12h · certificado ao final
- Entendendo arquiteturas de RAG: do básico ao híbrido
- Selecionando modelos grandes e rápidos para casos de uso específicos
- Configurando embeddings e bancos de vetores para otimização de busca
- Integrando modelos rápidos (ex: Phi-3, Mistral-7B) em pipelines de RAG
- Combinando respostas de modelos grandes (ex: Llama3, GPT-4) com modelos rápidos
- Avaliar trade-offs entre precisão, latência e custo em sistemas híbridos
- Implementando fallback e estratégias de roteamento inteligente
- Projeto Final: Construir um sistema de RAG híbrido com deploy em cloud
Projeto Final
Um sistema de RAG híbrido funcional, com documentação técnica e métricas de desempenho, deployado em um ambiente cloud (AWS/GCP)
