2026
PolyRAG
RAG federado e local

Escolhe o armazenamento certo (grafo, vetorial ou relacional) por cálculo, não por agente, e mostra a rota e cada etapa do pipeline. Roda localmente em GPU AMD via Vulkan.
Coloque uma planilha, um recibo escaneado e um documento de política numa pasta. O PolyRAG lê cada arquivo, divide em trechos e decide, trecho a trecho, se ele vai para uma tabela SQL, um índice vetorial ou um grafo de conhecimento. Na hora da pergunta, a mesma decisão escolhe onde procurar.
A premissa é o oposto dos RAGs baseados em agentes: usar matemática determinística sempre que ela consegue decidir e deixar o modelo só para escrever a resposta. Cada etapa se reporta ao vivo, então dá para ver a rota escolhida e os números por trás dela.
Roteamento por cálculo
Similaridade de cosseno com margem contra âncoras de configuração, uma heurística de tabularidade antes e a evidência das seções de cada base só em caso de empate.
Três bases, um motor
SQLite com Text-to-SQL, Qdrant com HNSW e um grafo em networkx consultado por PageRank personalizado.
Tudo observável
Spans do OpenTelemetry chegam por WebSocket à interface: o placar de cada rota, a margem que decidiu e a latência de cada passo.
100% local
Três modelos servidos pelo llama.cpp em GPU AMD via Vulkan, sem CUDA, Docker ou nuvem. Funciona entre idiomas graças aos embeddings do BGE-M3.