
Uma base de conhecimento para agente de IA é um conjunto governado de informações aprovadas que o sistema pode localizar e usar para responder, orientar ou executar ações. Ela não é apenas uma pasta com PDFs: precisa de escopo, estrutura, metadados, atualização, permissões, testes, rastreabilidade e regras claras para quando o agente não deve responder.
Quando a base é fraca, o agente pode recuperar conteúdo desatualizado, misturar políticas, omitir contexto ou improvisar. Quando é bem estruturada, ela reduz inconsistência, facilita auditoria e permite evoluir o atendimento sem reescrever todas as instruções.
Base de conhecimento, treinamento e RAG não são a mesma coisa
O modelo de linguagem possui conhecimento geral aprendido durante treinamento. A base de conhecimento fornece informações específicas e atualizáveis da empresa. Em uma arquitetura de Retrieval-Augmented Generation (RAG), o sistema busca trechos relevantes antes de gerar a resposta.
| Componente | Função | Exemplo |
|---|---|---|
| Modelo | Compreender e gerar linguagem | Interpretar a pergunta |
| Base | Guardar conhecimento aprovado | Políticas, serviços e FAQs |
| Recuperação | Localizar conteúdo relevante | Buscar regra de cancelamento |
| Instruções | Definir comportamento | Não informar preço sem fonte vigente |
| Ferramentas | Consultar ou alterar sistemas | CRM, agenda e estoque |
Quais conteúdos devem entrar?
- Descrição de produtos e serviços.
- Políticas comerciais, operacionais e de atendimento.
- Perguntas frequentes aprovadas.
- Procedimentos e critérios de encaminhamento.
- Glossário da empresa e do setor.
- Manuais e documentação técnica vigente.
- Limites do atendimento e informações proibidas.
- Responsáveis e canais de escalonamento.
O que deve ficar fora ou sob acesso restrito?
Não inclua dados pessoais, credenciais, documentos confidenciais ou informações sem necessidade operacional. Separe conhecimento público, interno e restrito. O agente deve acessar apenas o mínimo necessário para o caso e para o usuário autorizado.
Rascunhos, versões antigas, conversas internas e documentos contraditórios devem ficar fora da fonte ativa. Se duas políticas divergem, a base precisa indicar qual prevalece; não transfira esse conflito para o modelo.
Como criar a base em 10 etapas
1. Defina casos de uso e limites
Liste as perguntas e ações que o agente deve atender. Defina também o que ele não pode fazer. Uma base para qualificação de leads não precisa conter toda a documentação financeira da empresa.
2. Nomeie responsáveis
Cada domínio precisa de um proprietário: comercial, atendimento, jurídico, produto ou operação. A equipe de tecnologia não deve decidir sozinha qual política é válida.
3. Faça inventário das fontes
Registre documento, origem, dono, data, validade, público, nível de acesso e status de aprovação. Essa planilha inicial revela duplicidades e lacunas.
4. Escolha a fonte canônica
Para cada assunto, defina uma fonte oficial. Se preço está no ERP e num PDF, indique qual sistema prevalece e quando a informação deve ser consultada em tempo real.
5. Normalize o conteúdo
Use títulos descritivos, parágrafos diretos, listas e tabelas legíveis. Remova cabeçalhos repetidos, rodapés, digitalizações ruins e conteúdo irrelevante. Informação crítica escondida em imagem é mais difícil de recuperar e verificar.
6. Divida por unidades de significado
Os trechos devem preservar contexto suficiente. Fragmentos pequenos demais perdem nuance; grandes demais diluem relevância. Organize por pergunta, regra, procedimento, produto ou etapa da jornada, sem criar páginas artificiais apenas para manipular mecanismos de busca.
7. Adicione metadados
Metadados úteis incluem assunto, produto, público, região, versão, vigência, confidencialidade e responsável. A documentação da OpenAI permite associar atributos a arquivos em vector stores, viabilizando filtros antes da recuperação.
8. Defina regras de resposta
O agente deve responder com base nas fontes recuperadas, distinguir fato de hipótese, não preencher lacunas e pedir ajuda quando a evidência for insuficiente. Para temas sensíveis, exija confirmação humana.
9. Implemente fallback e escalonamento
Fallback é o comportamento seguro quando a base não resolve o caso. Pode significar pedir uma informação adicional, abrir ticket, transferir para pessoa ou responder que a confirmação será feita. “Inventar para não deixar o cliente sem resposta” nunca é fallback aceitável.
10. Teste e monitore
Crie um conjunto de avaliação com perguntas frequentes, raras, ambíguas, contraditórias e maliciosas. Registre fonte recuperada, resposta, confiança operacional, necessidade de transferência e correção humana.
Arquitetura recomendada
- Usuário envia a pergunta.
- Sistema identifica intenção, identidade e permissões.
- Busca recupera fontes relevantes e vigentes.
- Regras verificam se há evidência suficiente.
- Modelo gera resposta fundamentada.
- Ferramenta consulta ou atualiza sistemas, quando autorizado.
- Logs registram fontes, ação e resultado.
- Casos incertos seguem para humano.
Segurança: os riscos que precisam ser tratados
Prompt injection
Conteúdo externo pode tentar instruir o agente a ignorar regras. Documentos e páginas recuperadas devem ser tratados como dados, não como autoridade para mudar políticas do sistema.
Exposição de informação sensível
Permissões precisam ser aplicadas antes da recuperação. Não basta pedir ao modelo que “não mostre” um dado que já foi inserido no contexto.
Conteúdo desatualizado
Use vigência, revisão e expiração. Uma resposta tecnicamente fiel a uma política antiga continua errada.
Ações indevidas
Responder e executar são riscos diferentes. Alterar agenda, preço, pedido ou cadastro exige autenticação, autorização, validação e idempotência.
Métricas para acompanhar
| Métrica | O que revela |
|---|---|
| Precisão fundamentada | Resposta está correta e apoiada em fonte? |
| Taxa de recuperação | Fonte relevante apareceu entre os resultados? |
| Cobertura | Quantas perguntas válidas a base resolve? |
| Abstenção correta | Agente deixa de responder quando deveria? |
| Escalonamento | Quantos casos e por quais motivos chegam ao humano? |
| Atualidade | Quantas fontes estão vencidas ou sem proprietário? |
| Correção humana | Quais respostas exigem ajuste após entrega? |
Checklist para produção
- Casos de uso e proibições documentados.
- Fonte canônica definida por assunto.
- Documentos aprovados, legíveis e versionados.
- Metadados e permissões aplicados.
- Fallback e transferência humana configurados.
- Conjunto de testes representativo.
- Logs sem exposição desnecessária de dados.
- Responsável e ciclo de revisão definidos.
Perguntas frequentes
Basta enviar PDFs para a IA?
Não. PDFs podem ser fontes, mas precisam estar legíveis, vigentes, sem contradições e associados a escopo, metadados, permissões e testes.
A base elimina alucinações?
Ela reduz o risco ao fornecer evidência atualizada, mas não garante erro zero. Instruções, avaliação, abstenção, supervisão e controles continuam necessários.
Quando consultar sistema em vez de documento?
Use sistema para informação dinâmica, como disponibilidade, status, saldo, agenda e preço vigente. Documentos funcionam melhor para políticas, explicações e procedimentos.
Com que frequência revisar?
Depende da volatilidade. Conteúdo comercial dinâmico pode exigir sincronização frequente; políticas estáveis podem seguir revisão mensal ou trimestral. Toda fonte deve ter dono e gatilho de atualização.
A KEZAE AI estrutura a base, conecta o agente a fontes e sistemas, cria testes e define escalonamento humano. O objetivo não é apenas responder mais: é responder com consistência, evidência e controle suficientes para operar no negócio.
Leia também
- Agente de IA, chatbot ou automação tradicional: qual escolher?.
- Como um agente de IA consulta CRM, agenda e sistemas antes de responder.