Como um assistente interno responde com os documentos da empresa sem inventar?

Ele procura, num conjunto combinado de documentos da empresa, os trechos que correspondem à pergunta, entrega ao modelo só esses trechos e manda responder com base neles, citando a fonte. Quando não acha nada relevante, diz isso e indica a pessoa responsável pelo assunto, em vez de chutar. Esse padrão se chama geração aumentada por recuperação, ou RAG.

Ele reduz as respostas inventadas; não elimina. O que o mantém honesto é a citação visível em toda resposta, um "não sei" claro, documentos atualizados e um conjunto de perguntas reais conferido antes de colocar no ar e depois de cada mudança nos documentos.

Atualizado em 28 de set. de 2026

Como funciona

  1. Escolher os documentos e um responsável para cada um

    Políticas, manuais, tabelas de preço, procedimentos, o modelo de contrato de locação da imobiliária. Tire as versões antigas para existir uma cópia de cada regra e defina quem atualiza.

  2. Dividir e indexar

    Cada documento é dividido em trechos, e cada trecho vira um embedding, uma lista de números que representa o significado, guardado num índice de busca. Muitas configurações somam busca por palavra-chave para nomes e códigos.

  3. Buscar antes de responder, respeitando o acesso

    A pergunta encontra os trechos mais próximos. As regras de acesso valem nessa etapa, então uma pergunta nunca traz um trecho que a pessoa não poderia abrir.

  4. Responder só com os trechos, citando a fonte

    O modelo recebe a ordem de responder com os trechos encontrados, indicar documento e seção, e dizer que não sabe quando eles não cobrem a pergunta.

  5. Testar com perguntas reais

    Junte perguntas que a equipe realmente faz, cada uma com a resposta certa e a fonte. Confira antes de colocar no ar e de novo sempre que os documentos mudarem.

  6. Manter os documentos atualizados

    Quando um documento muda, indexe de novo. Uma regra desatualizada no índice é citada com a mesma segurança que a atual.

Quanto custa manter

Os custos vêm de três lugares: transformar os documentos em embeddings, guardar e buscar esses embeddings num banco vetorial, e o modelo que escreve cada resposta. Abaixo estão preços de tabela das páginas dos fornecedores, em dólar; um conjunto pequeno de documentos pode caber no plano gratuito nos dois primeiros, e o custo do modelo cresce com o número de perguntas.

ItemPreço de tabelaFonte
Plano Starter da Pinecone (banco vetorial)Gratuito; até 2 GB de armazenamento, 2 milhões de unidades de escrita e 1 milhão de unidades de leitura por mêsPinecone, PricingConsultado em 28 de set. de 2026
Plano Standard da PineconeUso mínimo de US$ 50 por mês; armazenamento a US$ 0,33 por GB por mês; leituras de US$ 16 a US$ 18 por milhão de unidades, conforme nuvem e regiãoPinecone, PricingConsultado em 28 de set. de 2026
Embeddings com multilingual-e5-large na Pinecone (funciona com português)US$ 0,08 por milhão de tokens no Standard; 5 milhões de tokens por mês incluídos no StarterPinecone, PricingConsultado em 28 de set. de 2026
Claude Sonnet 5 pela API da Anthropic (escreve as respostas)US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de tokens de saídaAnthropic, Claude API Docs, PricingConsultado em 28 de set. de 2026
Claude Haiku 4.5 pela API da AnthropicUS$ 1 por milhão de tokens de entrada, US$ 5 por milhão de tokens de saídaAnthropic, Claude API Docs, PricingConsultado em 28 de set. de 2026

Preços de tabela de terceiros, consultados na data indicada. Não são preços da Betterlane.

O que aprendemos montando

Das nossas demonstrações com dados inventados, setembro de 2026: um chat baseado em documento para um coworking fictício (Cedar Workspace) e uma bateria de testes para os relatórios de um agente de pesquisa sobre duas empresas fictícias. Nenhuma é sistema de cliente.

Mostre o trecho, não só a resposta
Na demonstração Cedar Workspace, toda resposta coberta destaca o trecho do documento de onde veio, e o documento real pode ser aberto ao lado do chat.
Mudou o documento, muda a resposta
Um teste altera o documento de origem e confere que a resposta seguinte muda. É assim que se sabe que o assistente lê o documento, em vez de repetir algo fixo.
Informação que falta recebe resposta explícita
O próprio documento diz que só o que está escrito nele é aprovado, e a demonstração diz com clareza quando a pergunta não está coberta. Ela usa regras de correspondência e seleção de seções, não um modelo de linguagem, por isso é mais rígida do que um modelo seria.
Reprove qualquer afirmação sem fonte
Nossa bateria de testes do agente de pesquisa reprova um relatório com motivos legíveis, como uma lacuna sem evidência ou um e-mail marcado como verificado sem fonte. A mesma verificação serve para um assistente interno: resposta sem citação é reprovada.

Quando não vale a pena

  • Se a equipe faz poucas perguntas por semana e os documentos são poucos, uma pasta compartilhada bem organizada, com busca, resolve.
  • Se os documentos se contradizem ou estão desatualizados, o assistente vai citar o errado com toda a confiança. Arrume os documentos primeiro.
  • Se as respostas dependem de dados ao vivo de outro sistema (imóveis disponíveis, agenda, saldos), isso é uma integração com esse sistema, não uma busca em documentos.

Perguntas

O modelo precisa ser treinado com os nossos documentos?

Não. Os documentos são buscados no momento de cada pergunta. Se o fornecedor do modelo guarda ou usa os dados enviados depende dos termos dele; leia antes de conectar documentos sensíveis.

Pessoas diferentes podem ver documentos diferentes?

Sim, se as regras de acesso forem aplicadas na busca dos trechos. Assim uma pergunta não traz um trecho que quem perguntou não poderia abrir.

Ele responde dúvidas de RH, jurídicas ou médicas?

Ele pode indicar o trecho da regra que se aplica. Decisões, e qualquer assunto sobre uma pessoa específica, ficam com o colega responsável.

Como manter tudo atualizado?

Dê um responsável a cada documento, indexe de novo quando ele mudar e tire as versões antigas do conjunto.

Quer um assistente que responda a sua equipe com os seus documentos e mostre de onde veio cada resposta?

Ver o serviço: Assistentes de conhecimentoFale com a gente

Todos os guias