Visualizador de Chunks para RAG

Divida texto em chunks de retrieval com quatro estratégias clássicas — tamanho fixo, recursiva, por sentença e por tokens exatos — e veja exatamente o que seus embeddings vão ingerir. 100% no navegador.

Texto de Origem

Controles de Chunking

Ajuste estratégia, tamanho e overlap — a unidade depende da estratégia (caracteres)

Estatísticas

0Chunks
0Tokens totais
0Mín
0Média
0Máx
Separadores recursivos

Sobre esta estratégia

Divide por parágrafo, depois linha, depois parte de sentença, depois espaço — o padrão em pipelines estilo LangChain. Preserva fronteiras naturais para prosa.

Sobre a contagem de tokens:

As contagens usam o encoding cl100k (família GPT-4) rodando localmente via js-tiktoken. Modelos de embedding usam tokenizers diferentes, então trate as contagens como aproximação próxima. Seu texto nunca sai do navegador.

Como Usar a Ferramenta

A estratégia de chunking é a variável escondida por trás da qualidade do RAG: ela decide o que cada embedding representa. Esta ferramenta torna a divisão visível para você ajustar tamanho, overlap e estratégia contra o seu corpus real.

  1. Carregue seu texto: Cole, ou envie um arquivo .txt/.md — tudo fica no seu navegador.
  2. Escolha uma estratégia: Recursiva para prosa, fixa para texto estruturado, por sentença para precisão, tokens exatos para alinhamento de custo.
  3. Ajuste tamanho e overlap: Observe a distribuição: amplitude min/max estreita significa chunks uniformes, que geralmente recuperam de forma mais previsível.
  4. Exporte os chunks: Baixe o payload JSON — índice, offset, tokens e texto por chunk — pronto para alimentar seu pipeline de embeddings.

Perguntas Frequentes (FAQ)

Qual tamanho de chunk devo usar para RAG?

Não existe número universal, mas 256-512 tokens é a faixa inicial comum para Q&A sobre prosa: pequeno o bastante para manter os embeddings focados, grande o bastante para carregar contexto. Teste contra seus próprios evals de retrieval — o tamanho certo depende da densidade dos seus documentos.

Por que o overlap importa?

Um split pode cortar uma frase ou linha de tabela ao meio. Com overlap, o conteúdo da fronteira aparece completo no chunk vizinho, então pelo menos um embedding o representa inteiro. Valores típicos são 10-20% do tamanho do chunk.

Qual estratégia equivale ao padrão do LangChain?

Separadores recursivos espelha o RecursiveCharacterTextSplitter, o padrão do LangChain: tenta quebras de parágrafo primeiro, cai para linhas, depois partes de sentença, depois espaços — preservando ao máximo as fronteiras naturais.

Meu documento é enviado para algum servidor?

Não. Divisão, tokenização e visualização rodam em JavaScript no seu navegador, e o export JSON é gerado localmente. Não há nenhuma chamada de rede.

Compartilhar esta ferramenta