1 / 9

Panorama

Duas perguntas diferentes

Do texto à resposta, com o caminho

A tese desta página: embedding responde "o que se parece com isto". Grafo responde "o que se conecta a isto". São perguntas diferentes, e a maior parte da frustração com busca semântica vem de fazer a segunda esperando que a primeira responda. A boa notícia é que dá para saber de antemão qual das duas você tem e as etapas 1 e 4 mostram exatamente como.

Quando o vetor basta (a maioria das vezes)

  • perguntas de um salto: "o que é X", "como faço Y"
  • busca por tema, onde o resultado certo é textualmente parecido
  • corpus sem estrutura clara de entidades e relações

Quando ele não basta

  • múltiplos saltos: a resposta não se parece com a pergunta
  • agregação: "quantos", "todos os", "qual a soma de"
  • perguntas globais: "quais são os grandes temas deste corpus"

Explore cada etapa →

A matemática, num só lugar

As 4 contas desta página. Clique em qualquer uma para pular direto para a etapa que a explica.

Honestidade, antes de começar: o conjunto de dados é fictício e minúsculo 14 entidades e 18 relações sobre uma cadeia de suprimento inventada. É pequeno de propósito: dá para você conferir cada resposta contando com o dedo, que é o objetivo. O que roda de verdade: o layout (força-mola determinística, mesmo desenho em toda visita), a travessia (busca em largura), a busca vetorial (cosseno sobre embeddings derivados do texto de cada nó), a detecção de comunidades (propagação de rótulos) e a fusão de rankings (RRF). O embedding é de saco de palavras com hashing, muito mais pobre que um modelo real mas é o mesmo mecanismo dos dois lados da comparação, então o vetor não perde por estar mal implementado. Ele perde porque a pergunta é outra.