Como um assistente interno responde com os documentos da empresa sem inventar?
Ele procura, num conjunto combinado de documentos da empresa, os trechos que correspondem à pergunta, entrega ao modelo só esses trechos e manda responder com base neles, citando a fonte. Quando não acha nada relevante, diz isso e indica a pessoa responsável pelo assunto, em vez de chutar. Esse padrão se chama geração aumentada por recuperação, ou RAG.
Ele reduz as respostas inventadas; não elimina. O que o mantém honesto é a citação visível em toda resposta, um "não sei" claro, documentos atualizados e um conjunto de perguntas reais conferido antes de colocar no ar e depois de cada mudança nos documentos.
Como funciona
Escolher os documentos e um responsável para cada um
Políticas, manuais, tabelas de preço, procedimentos, o modelo de contrato de locação da imobiliária. Tire as versões antigas para existir uma cópia de cada regra e defina quem atualiza.
Dividir e indexar
Cada documento é dividido em trechos, e cada trecho vira um embedding, uma lista de números que representa o significado, guardado num índice de busca. Muitas configurações somam busca por palavra-chave para nomes e códigos.
Buscar antes de responder, respeitando o acesso
A pergunta encontra os trechos mais próximos. As regras de acesso valem nessa etapa, então uma pergunta nunca traz um trecho que a pessoa não poderia abrir.
Responder só com os trechos, citando a fonte
O modelo recebe a ordem de responder com os trechos encontrados, indicar documento e seção, e dizer que não sabe quando eles não cobrem a pergunta.
Testar com perguntas reais
Junte perguntas que a equipe realmente faz, cada uma com a resposta certa e a fonte. Confira antes de colocar no ar e de novo sempre que os documentos mudarem.
Manter os documentos atualizados
Quando um documento muda, indexe de novo. Uma regra desatualizada no índice é citada com a mesma segurança que a atual.
Quanto custa manter
Os custos vêm de três lugares: transformar os documentos em embeddings, guardar e buscar esses embeddings num banco vetorial, e o modelo que escreve cada resposta. Abaixo estão preços de tabela das páginas dos fornecedores, em dólar; um conjunto pequeno de documentos pode caber no plano gratuito nos dois primeiros, e o custo do modelo cresce com o número de perguntas.
| Item | Preço de tabela | Fonte |
|---|---|---|
| Plano Starter da Pinecone (banco vetorial) | Gratuito; até 2 GB de armazenamento, 2 milhões de unidades de escrita e 1 milhão de unidades de leitura por mês | Pinecone, PricingConsultado em 28 de set. de 2026 |
| Plano Standard da Pinecone | Uso mínimo de US$ 50 por mês; armazenamento a US$ 0,33 por GB por mês; leituras de US$ 16 a US$ 18 por milhão de unidades, conforme nuvem e região | Pinecone, PricingConsultado em 28 de set. de 2026 |
| Embeddings com multilingual-e5-large na Pinecone (funciona com português) | US$ 0,08 por milhão de tokens no Standard; 5 milhões de tokens por mês incluídos no Starter | Pinecone, PricingConsultado em 28 de set. de 2026 |
| Claude Sonnet 5 pela API da Anthropic (escreve as respostas) | US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de tokens de saída | Anthropic, Claude API Docs, PricingConsultado em 28 de set. de 2026 |
| Claude Haiku 4.5 pela API da Anthropic | US$ 1 por milhão de tokens de entrada, US$ 5 por milhão de tokens de saída | Anthropic, Claude API Docs, PricingConsultado em 28 de set. de 2026 |
Preços de tabela de terceiros, consultados na data indicada. Não são preços da Betterlane.
O que aprendemos montando
Das nossas demonstrações com dados inventados, setembro de 2026: um chat baseado em documento para um coworking fictício (Cedar Workspace) e uma bateria de testes para os relatórios de um agente de pesquisa sobre duas empresas fictícias. Nenhuma é sistema de cliente.
- Mostre o trecho, não só a resposta
- Na demonstração Cedar Workspace, toda resposta coberta destaca o trecho do documento de onde veio, e o documento real pode ser aberto ao lado do chat.
- Mudou o documento, muda a resposta
- Um teste altera o documento de origem e confere que a resposta seguinte muda. É assim que se sabe que o assistente lê o documento, em vez de repetir algo fixo.
- Informação que falta recebe resposta explícita
- O próprio documento diz que só o que está escrito nele é aprovado, e a demonstração diz com clareza quando a pergunta não está coberta. Ela usa regras de correspondência e seleção de seções, não um modelo de linguagem, por isso é mais rígida do que um modelo seria.
- Reprove qualquer afirmação sem fonte
- Nossa bateria de testes do agente de pesquisa reprova um relatório com motivos legíveis, como uma lacuna sem evidência ou um e-mail marcado como verificado sem fonte. A mesma verificação serve para um assistente interno: resposta sem citação é reprovada.
Quando não vale a pena
- Se a equipe faz poucas perguntas por semana e os documentos são poucos, uma pasta compartilhada bem organizada, com busca, resolve.
- Se os documentos se contradizem ou estão desatualizados, o assistente vai citar o errado com toda a confiança. Arrume os documentos primeiro.
- Se as respostas dependem de dados ao vivo de outro sistema (imóveis disponíveis, agenda, saldos), isso é uma integração com esse sistema, não uma busca em documentos.
Perguntas
O modelo precisa ser treinado com os nossos documentos?
Não. Os documentos são buscados no momento de cada pergunta. Se o fornecedor do modelo guarda ou usa os dados enviados depende dos termos dele; leia antes de conectar documentos sensíveis.
Pessoas diferentes podem ver documentos diferentes?
Sim, se as regras de acesso forem aplicadas na busca dos trechos. Assim uma pergunta não traz um trecho que quem perguntou não poderia abrir.
Ele responde dúvidas de RH, jurídicas ou médicas?
Ele pode indicar o trecho da regra que se aplica. Decisões, e qualquer assunto sobre uma pessoa específica, ficam com o colega responsável.
Como manter tudo atualizado?
Dê um responsável a cada documento, indexe de novo quando ele mudar e tire as versões antigas do conjunto.
Quer um assistente que responda a sua equipe com os seus documentos e mostre de onde veio cada resposta?
Ver o serviço: Assistentes de conhecimentoFale com a genteTodos os guias
- O que um agente de voz deve atender, e o que precisa passar para uma pessoa?
- O que um chatbot faz no site de uma pequena empresa, e quando vale a pena?
- Como conectar o WhatsApp a um assistente pela Cloud API da Meta?
- Como automatizar a caixa de suporte sem enviar uma resposta errada?
- n8n, Zapier ou Make: qual escolher para uma pequena empresa?
- Como extrair dados de centenas de PDFs?
- Como montar um relatório que se atualiza sozinho quando os dados mudam?
- Como automatizar a produção de conteúdo sem perder o controle editorial?
- Como montar uma lista de prospects com fontes, sem comprar uma?
- O que um site de pequena empresa precisa para ser encontrado pelo Google e pelo ChatGPT?
- Quando uma empresa precisa de um portal do cliente em vez de e-mail?
- Quando vale tirar um processo da planilha e levar para uma ferramenta interna?
- Por que o meu fluxo do n8n roda duas vezes para a mesma coisa?
- Meu fluxo do n8n funcionava e agora falha com 401 ou 403. Por quê?
- Como saber quando um fluxo do n8n falha em silêncio?