Agent

O bloco Agent executa um modelo dentro de um workflow. Você fornece instruções, contexto e tools; o modelo raciocina sobre a entrada, chama as tools que precisar e devolve texto simples ou JSON estruturado que os blocks seguintes leem por referência. A maioria dos workflows é construída em torno de um ou mais blocks Agent.

Um agente e um bloco Agent são coisas relacionadas, mas distintas. Um agente é um workflow inteiro que raciocina e age por conta própria; um bloco Agent é um único passo de raciocínio dentro dele. O agente mais simples é um único bloco Agent com tools, e os maiores combinam vários deles com outros blocks. Veja Agentes.

Configuração

Messages

As mensagens enviadas ao modelo. Cada mensagem tem um papel: System define a função e as regras do agente, User entrega a entrada sobre a qual ele deve agir. Insira uma connection tag para passar uma saída anterior, como <start.input>.

You are a support assistant for an analytics product.
Answer in two sentences, cite the doc you used, and never guess a price.

Model

O modelo que executa o passo. O padrão é claude-sonnet-4-6. Digite ou escolha qualquer modelo da OpenAI, Anthropic, Google, xAI, Groq, Cerebras, DeepSeek, Azure, AWS Bedrock, Google Vertex ou OpenRouter, ou um modelo local via Ollama ou VLLM.

Files

Arquivos para o modelo ler: imagens para um modelo com visão, ou documentos para texto. Faça o upload no próprio block, ou passe um arquivo de um block anterior — como um trigger de upload ou uma resposta de API — com uma connection tag.

Tools

Capacidades que o agente pode chamar durante a execução: buscar em uma base de conhecimento, enviar uma mensagem no Slack, executar uma Function, chamar qualquer uma das integrações ou usar uma tool personalizada ou servidor MCP que você adicionou. O modelo decide qual chamar e quando. (Para saber de onde vêm as tools e quando usar cada uma, veja Agentes.) Cada tool tem um controle de uso:

  • Auto. O modelo chama quando o contexto justifica.
  • Force. O modelo precisa chamar em toda execução.
  • None. A tool fica oculta para o modelo, o que a desativa sem removê-la do block.

Skills

Skills de agente que o agente pode carregar sob demanda: pacotes de instruções reutilizáveis, como um padrão de código ou um manual de atendimento. Apenas os nomes das skills ficam no contexto de início, e o agente carrega as instruções completas quando decide que uma skill é relevante.

Memory

Memória de conversa nativa, mantida entre execuções por um ID de conversa:

  • None. Cada execução é independente.
  • Conversation. O histórico completo daquele ID de conversa.
  • Sliding window (messages). As N mensagens mais recentes.
  • Sliding window (tokens). Mensagens recentes até um limite de tokens.

A memória precisa de um ID de conversa para persistir entre execuções. Para uma memória compartilhada entre workflows ou gerenciada como um repositório próprio, use o block Memory.

Response Format

Dê ao agente um JSON Schema para forçar saída estruturada. A resposta fica restrita ao schema, e cada campo se torna uma saída própria que você lê pelo nome, como <agent.sentiment>. Sem um response format, o agente devolve texto simples em content.

{
  "name": "user_analysis",
  "schema": {
    "type": "object",
    "properties": {
      "sentiment": { "type": "string", "enum": ["positive", "negative", "neutral"] },
      "confidence": { "type": "number", "minimum": 0, "maximum": 1 }
    },
    "required": ["sentiment", "confidence"]
  }
}

Advanced

Algumas configurações ficam em advanced, ou aparecem apenas para modelos que as suportam:

  • Temperature. O quanto a saída varia. Mantenha baixa (0–0,3) quando você precisa de precisão e repetibilidade, no meio (perto de 0,5) para o trabalho do dia a dia, e mais alta (0,7+) quando quer variedade criativa.
  • Max output tokens. Limita o tamanho da resposta. O padrão é o limite total do modelo.
  • Reasoning effort / Thinking level. Para modelos com raciocínio estendido, quanto o modelo pensa antes de responder. Níveis mais altos são mais completos, mas mais lentos e custam mais tokens.
  • Prompt caching. Para modelos Claude da Anthropic, reaproveita o system prompt e as definições de tools entre execuções em vez de reprocessá-los toda vez. A entrada em cache custa um décimo da taxa normal, mas escrever o cache custa 1,25x — então deixe desligado para execuções isoladas e ligue quando o mesmo agente roda repetidamente. O cache cobre um prefixo só se ele alcançar 1.024 tokens (2.048 no Haiku) — abaixo disso a Anthropic ignora e nada muda. As entradas expiram após cinco minutos sem uso.
  • API key. Sua chave para o provedor escolhido. Fica oculta no Studio hospedado, que fornece uma.

OpenAI e Gemini fazem cache automaticamente sem custo extra e não exigem configuração; o desconto já está refletido no que é cobrado de você.

Saídas

Depois que o agente executa, os blocks seguintes leem o resultado pelo nome:

SaídaO que é
<agent.content>A resposta: texto, ou o objeto estruturado quando há um response format definido
<agent.tokens>Uso de tokens, um objeto { input, output, total }
<agent.toolCalls>As tools que o agente chamou, com suas entradas e resultados
<agent.model>O modelo que executou o passo
<agent.cost>Custo estimado da chamada

Quando há um response format definido, seus campos podem ser lidos diretamente, como <agent.sentiment>.

Raciocínio e chamadas de tools em tempo real

Enquanto um agente executa, o Studio pode transmitir ao vivo o raciocínio e o ciclo de vida das tools — o terminal do workflow builder sempre os mostra, e um chat deployado os mostra quando a configuração Include thinking e o opt-in de protocolo do cliente concordam. O que realmente é transmitido depende do modelo: modelos marcados com deltas completos ou resumos transmitem o raciocínio quando um Thinking level ou Reasoning effort está definido (modelos reasoner da DeepSeek sempre raciocinam); um modelo marcado como "Não transmitido" pensa internamente, mas o provedor não libera o texto.

Os chips de chamada de tool em tempo real são transmitidos para modelos OpenAI, Anthropic, Azure Anthropic, Google, Vertex AI, DeepSeek, Groq, AWS Bedrock. Outros provedores executam as tools sem chips ao vivo e projetam a resposta final consolidada quando a execução termina; eles não pedem ao modelo para gerar essa resposta de novo só para criar um stream.

ProvedorRaciocínio transmitidoModelos
OpenAISomente resumos — Requer verificação da organização na OpenAI; sem ela, não há resumos.gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna, gpt-5.5-pro, gpt-5.5, gpt-5.4-pro, gpt-5.4, gpt-5.4-mini, gpt-5.4-nano, gpt-5.2-pro, gpt-5.2, gpt-5.1, gpt-5-pro, gpt-5, gpt-5-mini, gpt-5-nano, o4-mini, o3, o3-mini, o1
AnthropicSomente resumos — Estas gerações omitem o raciocínio completo; o Studio solicita raciocínio resumido em execuções com streaming.claude-fable-5, claude-sonnet-5, claude-opus-5, claude-opus-4-8, claude-opus-4-7, claude-opus-4-6, claude-sonnet-4-6, claude-opus-4-5, claude-opus-4-1, claude-sonnet-4-5, claude-haiku-4-5
Azure OpenAISomente resumos — Requer verificação da organização na OpenAI; sem ela, não há resumos.azure/gpt-5.4, azure/gpt-5.4-mini, azure/gpt-5.4-nano, azure/gpt-5.2, azure/gpt-5.1, azure/gpt-5.1-codex, azure/gpt-5, azure/gpt-5-mini, azure/gpt-5-nano, azure/o3, azure/o4-mini
Azure AnthropicSomente resumos — Estas gerações omitem o raciocínio completo; o Studio solicita raciocínio resumido em execuções com streaming.azure-anthropic/claude-opus-4-6, azure-anthropic/claude-opus-4-5, azure-anthropic/claude-sonnet-4-5, azure-anthropic/claude-opus-4-1, azure-anthropic/claude-haiku-4-5
GoogleSomente resumosgemini-3.6-flash, gemini-3.5-flash-lite, gemini-3.5-flash, gemini-3.1-pro-preview, gemini-3.1-flash-lite, gemini-3-flash-preview, gemini-2.5-pro, gemini-2.5-flash, gemini-2.5-flash-lite
Vertex AISomente resumosvertex/gemini-3.5-flash, vertex/gemini-3.1-pro-preview, vertex/gemini-3.1-flash-lite, vertex/gemini-3-flash-preview, vertex/gemini-2.5-pro, vertex/gemini-2.5-flash, vertex/gemini-2.5-flash-lite
DeepSeekDeltas completos de raciocíniodeepseek-v4-pro, deepseek-v4-flash, deepseek-reasoner
xAIDeltas completos de raciocíniogrok-4.6, grok-4.5, grok-4.3, grok-4.20-multi-agent-0309
GroqDeltas completos de raciocíniogroq/openai/gpt-oss-120b, groq/openai/gpt-oss-20b, groq/openai/gpt-oss-safeguard-20b, groq/qwen/qwen3.6-27b
MetaNão transmitidomuse-spark-1.1
KimiDeltas completos de raciocíniokimi-k2.6
Z.aiDeltas completos de raciocínioglm-5.2, glm-5.1, glm-5, glm-5-turbo, glm-4.7, glm-4.6, glm-4.5, glm-4.5-air

Exemplo

Um workflow que lê uma mensagem recebida de um cliente e a classifica:

O Agent lê a mensagem do Start com <start.input> e devolve um resultado que os blocks seguintes leem como <agent.content>.

Boas práticas

  • Escreva uma system message clara. Defina o papel, o tom e os limites do agente. Instruções específicas produzem saídas mais confiáveis do que um prompt vago.
  • Ajuste modelo e temperature à tarefa. Use um modelo mais forte e temperature baixa (0–0,3) para precisão; aumente a temperature para saídas criativas ou variadas.
  • Dê ao agente apenas as tools de que ele precisa. Tools em excesso diluem as escolhas dele. Para trabalhos que não se sobrepõem, use um segundo bloco Agent em vez de sobrecarregar um só.
  • Use um response format quando um block seguinte precisar de campos específicos. Ele garante o formato, e você lê cada campo como <agent.field>.

Common Questions

OpenAI, Anthropic, Google (Gemini), xAI (Grok), DeepSeek, Groq, Cerebras, Azure OpenAI, Azure Anthropic, Google Vertex AI, AWS Bedrock, OpenRouter e modelos locais via Ollama ou VLLM. Digite ou selecione qualquer modelo suportado no combobox de modelos.
Quatro modos: None (sem memória, cada execução é independente), Conversation (histórico completo indexado por um ID de conversa), Sliding window por mensagens (as N mensagens mais recentes) e Sliding window por tokens (mensagens até um limite de tokens). A memória precisa de um ID de conversa para persistir entre execuções.
Em Auto, o modelo decide quando chamar uma tool com base no contexto. Em Force, o modelo precisa chamar a tool em toda execução. Em None, a tool fica oculta para o modelo e nunca é enviada, o que a desativa sem removê-la do block.
Ele força uma saída estruturada a partir de um JSON Schema. Quando definido, a resposta do modelo fica restrita ao schema exatamente, e cada campo é lido diretamente pelos blocks seguintes com <agent.fieldName>. Sem um response format, o agente devolve suas saídas padrão: content, model, tokens e toolCalls.
Elas aparecem apenas para modelos que suportam raciocínio estendido. Reasoning Effort (modelos da OpenAI, Azure OpenAI, xAI Grok, DeepSeek, Groq, Meta e Z.ai que aceitam um nível de esforço) e Thinking Level (modelos Claude da Anthropic e Gemini com thinking) controlam quanta computação o modelo gasta raciocinando antes de responder. Níveis mais altos produzem respostas mais completas, mas custam mais tokens e levam mais tempo.
Ligue quando o mesmo agente roda repetidamente com um system prompt grande e estável ou um conjunto fixo de tools — a entrada em cache é cobrada a um décimo da taxa normal de entrada. Deixe desligado para execuções isoladas, porque escrever o cache custa 1,25x e nada o lê depois. A configuração aparece apenas para modelos Claude da Anthropic; OpenAI e Gemini fazem cache automaticamente, sem configuração e sem taxa de escrita. A Anthropic só faz cache de um prefixo de no mínimo 1.024 tokens (2.048 no Haiku), e as entradas expiram após cinco minutos sem uso.
Por padrão, o bloco Agent usa o limite total de output tokens de cada modelo da Anthropic (por exemplo, 64.000 tokens). Você pode sobrescrever isso com a configuração Max Output Tokens. Para requisições sem streaming que passam do limite interno do SDK, o provedor usa streaming interno automaticamente para evitar timeouts.
Sim. Use qualquer modelo compatível com Ollama ou VLLM digitando o nome do modelo diretamente no combobox de modelos, desde que ele exponha um endpoint de API compatível.