Visão geral

A Knowledge Base permite enviar, processar e pesquisar seus documentos com busca vetorial e chunking inteligentes. Documentos de vários tipos são processados, transformados em embeddings e disponibilizados para busca automaticamente. Seus documentos são divididos em chunks de forma inteligente, e você pode visualizá-los, editá-los e pesquisá-los usando consultas em linguagem natural.

Upload e processamento

Basta enviar seus documentos para começar. O Seeyu Agent Studio os processa em segundo plano automaticamente, extraindo o texto, criando embeddings e dividindo tudo em chunks pesquisáveis.

O sistema cuida de todo o pipeline de processamento para você:

  1. Extração de texto: o conteúdo é extraído dos seus documentos com parsers especializados para cada tipo de arquivo
  2. Chunking inteligente: os documentos são divididos em chunks significativos, com tamanho e overlap configuráveis
  3. Geração de embeddings: embeddings vetoriais são criados para viabilizar a busca semântica
  4. Status de processamento: acompanhe o progresso conforme seus documentos são processados

Tipos de arquivo suportados

O Studio suporta arquivos PDF, Word (DOC/DOCX), texto puro (TXT), Markdown (MD), HTML, HTM, Excel (XLS/XLSX), PowerPoint (PPT/PPTX), CSV, JSON e YAML/YML. Cada arquivo pode ter até 100MB, com desempenho ideal em arquivos abaixo de 50MB. Você pode enviar vários documentos ao mesmo tempo, e arquivos PDF passam por OCR quando são digitalizados.

Visualizar e editar chunks

Depois que seus documentos são processados, você pode visualizar e editar cada chunk. Isso dá controle total sobre como o seu conteúdo é organizado e pesquisado.

Configuração de chunks

Ao criar uma base de conhecimento, você pode configurar como os documentos são divididos em chunks:

ConfiguraçãoUnidadePadrãoFaixaDescrição
Max Chunk Sizetokens1,024100-4,000Tamanho máximo de cada chunk (1 token ≈ 4 caracteres)
Min Chunk Sizecaracteres100100-2,000Tamanho mínimo do chunk, para evitar fragmentos minúsculos
Overlaptokens2000-500Overlap de contexto entre chunks consecutivos

Você também pode escolher uma estratégia de chunking (Auto, Text, Recursive, Sentence, Token ou Regex) para controlar onde as divisões acontecem. Veja Estratégias de chunking para saber quando usar cada uma.

  • Divisão hierárquica: respeita a estrutura do documento (seções, parágrafos, frases)

Recursos de edição

  • Editar o conteúdo do chunk: modifique o texto de cada chunk
  • Ajustar os limites do chunk: junte ou divida chunks conforme necessário
  • Adicionar metadados: enriqueça os chunks com contexto extra
  • Operações em massa: gerencie vários chunks de uma vez

Processamento avançado de PDF

Para documentos PDF, o Seeyu Agent Studio oferece recursos de processamento adicionais:

Suporte a OCR

Quando configurado com Azure ou Mistral OCR:

  • Processamento de documentos digitalizados: extraia texto de PDFs baseados em imagem
  • Conteúdo misto: processe PDFs com texto e imagens
  • Alta precisão: modelos de IA avançados garantem uma extração de texto precisa

Usar o bloco Knowledge em workflows

Depois que seus documentos são processados, você pode usá-los nos seus workflows de IA por meio do bloco Knowledge. Isso viabiliza a Retrieval-Augmented Generation (RAG), permitindo que seus agentes de IA acessem e raciocinem sobre o conteúdo dos seus documentos para dar respostas mais precisas e contextuais.

Recursos do bloco Knowledge

  • Busca semântica: encontre conteúdo relevante com consultas em linguagem natural
  • Integração de contexto: inclua automaticamente os chunks relevantes nos prompts do agente
  • Recuperação dinâmica: a busca acontece em tempo real durante a execução do workflow
  • Pontuação de relevância: os resultados são ordenados por similaridade semântica

Opções de integração

  • System prompts: forneça contexto aos seus agentes de IA
  • Contexto dinâmico: busque e inclua informações relevantes durante as conversas
  • Busca em vários documentos: consulte toda a sua base de conhecimento
  • Busca filtrada: combine com tags para uma recuperação de conteúdo precisa

Tecnologia de busca vetorial

O Seeyu Agent Studio usa busca vetorial com pgvector para entender o significado e o contexto do seu conteúdo:

Compreensão semântica

  • Busca contextual: encontra conteúdo relevante mesmo quando as palavras-chave exatas não aparecem
  • Recuperação por conceito: entende as relações entre ideias
  • Suporte a vários idiomas: funciona em idiomas diferentes
  • Reconhecimento de sinônimos: encontra termos e conceitos relacionados

Recursos de busca

  • Consultas em linguagem natural: faça perguntas em linguagem do dia a dia
  • Busca por similaridade: encontre conteúdo conceitualmente parecido
  • Busca híbrida: combina busca vetorial e busca tradicional por palavra-chave
  • Resultados configuráveis: controle a quantidade de resultados e o limite de relevância

Gerenciamento de documentos

Recursos de organização

  • Upload em massa: envie vários arquivos de uma vez pela API assíncrona
  • Status de processamento: atualizações em tempo real sobre o processamento dos documentos
  • Busca e filtro: encontre documentos rapidamente em coleções grandes
  • Registro de metadados: captura automática das informações do arquivo e dos detalhes de processamento

Segurança e privacidade

  • Armazenamento seguro: documentos armazenados com segurança de nível corporativo
  • Controle de acesso: permissões por workspace
  • Isolamento de processamento: cada workspace tem processamento de documentos isolado
  • Retenção de dados: configure políticas de retenção de documentos

Primeiros passos

  1. Acesse a sua base de conhecimento: entre pela barra lateral do workspace
  2. Envie documentos: arraste e solte ou selecione os arquivos
  3. Acompanhe o processamento: veja os documentos sendo processados e divididos em chunks
  4. Explore os chunks: visualize e edite o conteúdo processado
  5. Use em workflows: use o bloco Knowledge para integrar com os seus agentes de IA

A Knowledge Base transforma seus documentos estáticos em um recurso inteligente e pesquisável, que os seus workflows de IA podem aproveitar para respostas mais informadas e contextuais.

Common Questions

Arquivos PDF, Word (DOC/DOCX), texto puro (TXT), Markdown (MD), HTML, HTM, Excel (XLS/XLSX), PowerPoint (PPT/PPTX), CSV, JSON e YAML/YML.
Cada arquivo pode ter até 100 MB, com desempenho ideal em arquivos abaixo de 50 MB.
Sim. Você pode visualizar, editar, juntar, dividir e adicionar metadados a cada chunk depois que os documentos são processados.
Os documentos são transformados em vetores por modelos de IA. Quando você busca, a sua consulta também é transformada em vetor e comparada com os vetores dos documentos, encontrando conteúdo conceitualmente parecido — mesmo sem correspondência exata de palavras-chave.
Sim. Quando configurado com Azure ou Mistral OCR, o Studio consegue extrair texto de PDFs baseados em imagem e digitalizados.
Cada bloco Knowledge aponta para uma base de conhecimento específica. Você pode usar vários blocos Knowledge em um workflow para pesquisar em bases de conhecimento diferentes.
Ao criar uma base de conhecimento, você pode configurar o tamanho máximo do chunk (100-4,000 tokens), o tamanho mínimo do chunk (100-2,000 caracteres) e o overlap (0-500 tokens).