Visualizador de Chunks para RAG
Divida texto em chunks de retrieval com quatro estratégias clássicas — tamanho fixo, recursiva, por sentença e por tokens exatos — e veja exatamente o que seus embeddings vão ingerir. 100% no navegador.
Texto de Origem
Controles de Chunking
Ajuste estratégia, tamanho e overlap — a unidade depende da estratégia (caracteres)
Estatísticas
Sobre esta estratégia
Divide por parágrafo, depois linha, depois parte de sentença, depois espaço — o padrão em pipelines estilo LangChain. Preserva fronteiras naturais para prosa.
Sobre a contagem de tokens:
As contagens usam o encoding cl100k (família GPT-4) rodando localmente via js-tiktoken. Modelos de embedding usam tokenizers diferentes, então trate as contagens como aproximação próxima. Seu texto nunca sai do navegador.
Como Usar a Ferramenta
A estratégia de chunking é a variável escondida por trás da qualidade do RAG: ela decide o que cada embedding representa. Esta ferramenta torna a divisão visível para você ajustar tamanho, overlap e estratégia contra o seu corpus real.
- Carregue seu texto: Cole, ou envie um arquivo .txt/.md — tudo fica no seu navegador.
- Escolha uma estratégia: Recursiva para prosa, fixa para texto estruturado, por sentença para precisão, tokens exatos para alinhamento de custo.
- Ajuste tamanho e overlap: Observe a distribuição: amplitude min/max estreita significa chunks uniformes, que geralmente recuperam de forma mais previsível.
- Exporte os chunks: Baixe o payload JSON — índice, offset, tokens e texto por chunk — pronto para alimentar seu pipeline de embeddings.
Perguntas Frequentes (FAQ)
Qual tamanho de chunk devo usar para RAG?
Não existe número universal, mas 256-512 tokens é a faixa inicial comum para Q&A sobre prosa: pequeno o bastante para manter os embeddings focados, grande o bastante para carregar contexto. Teste contra seus próprios evals de retrieval — o tamanho certo depende da densidade dos seus documentos.
Por que o overlap importa?
Um split pode cortar uma frase ou linha de tabela ao meio. Com overlap, o conteúdo da fronteira aparece completo no chunk vizinho, então pelo menos um embedding o representa inteiro. Valores típicos são 10-20% do tamanho do chunk.
Qual estratégia equivale ao padrão do LangChain?
Separadores recursivos espelha o RecursiveCharacterTextSplitter, o padrão do LangChain: tenta quebras de parágrafo primeiro, cai para linhas, depois partes de sentença, depois espaços — preservando ao máximo as fronteiras naturais.
Meu documento é enviado para algum servidor?
Não. Divisão, tokenização e visualização rodam em JavaScript no seu navegador, e o export JSON é gerado localmente. Não há nenhuma chamada de rede.