Melhores autonomous AI agents em 2026: 9 ferramentas ranqueadas por até onde rodam sem você

Giroscópio de autonomous AI agent dentro de uma gaiola protetora, com uma chave de parada externa, um carretel de rollback e um sino de exceção

Turn this article into takeaways for your work.

Each assistant summarizes the article only for you and suggests best practices for your work.

Manus e Genspark chegam mais perto de um agente de uso geral a quem você pode entregar uma tarefa real e ir embora. Devin é a opção mais autônoma feita especificamente para entregar código. Skyvern é a escolha para workflows de navegador sem supervisão que, de outra forma, precisariam de uma API que não existe. E Lindy é a única feita para rodar continuamente a partir de um gatilho, e não apenas responder a um único prompt. Este guia ranqueia 9 agentes autônomos reais, que podem ser comprados hoje (não são plataformas para construir agentes, nem copilots de IA que esperam aprovação a cada linha), a partir de uma pergunta concreta: até onde uma execução realmente chega antes de algo quebrar ou de um humano precisar voltar à cena.

Todos os produtos abaixo lançaram uma versão funcional, de disponibilidade geral (ou um preview claramente identificado como tal) até agosto de 2026. Verificamos os preços na página de cada fornecedor e tiramos alguns nomes que você verá em outros lugares nesta categoria, porque se mostraram adquiridos, rebatizados ou abandonados, em vez de encher a lista só para chegar a um número redondo. Autonomous agents são a categoria mais exagerada em promessas no software de IA hoje, então cada pontuação de benchmark abaixo informa qual é o benchmark e a data em que foi medida, e dizemos com clareza onde o marketing de um fornecedor foi além do que revisores independentes de fato encontraram.

Atualizado em agosto de 2026: o que mudou

  • A OpenAI aposentou o Operator em 31 de agosto de 2025. Sua capacidade de dirigir o navegador foi incorporada ao ChatGPT agent, que unificou Operator e Deep Research em um único modo, selecionável no campo de mensagem a partir do Plus ($20/mês), em vez de restringi-lo ao antigo plano de lançamento exclusivo Pro, de $200/mês.
  • A Salesforce adquiriu a Convergence AI, criadora do agente Proxy, em um negócio concluído por volta de 11 de junho de 2025. Os assinantes existentes receberam e-mail e reembolso. O Proxy não é mais vendido como produto independente; a equipe e a tecnologia foram para o Agentforce.
  • A MultiOn foi rebatizada como AGI, Inc. e migrou para o AGI-0, um preview de agente móvel proativo, enquanto a API original da MultiOn segue como bloco de construção para desenvolvedores, e não como um produto de consumo acabado.
  • O repositório do AgentGPT no GitHub foi arquivado em 28 de janeiro de 2026. O site hospedado ainda carrega em um estado gratuito limitado, mas o projeto está congelado na especificação de 2023, sem novos desenvolvimentos.
  • A Cognition reformulou o preço self-serve do Devin em 14 de abril de 2026, trocando os antigos planos Core/Team por uma escada Free, Pro, Max, Teams, Enterprise.

Fatos Principais

  • Os AI agents saltaram de 12% para cerca de 66% de sucesso em tarefas no OSWorld, o benchmark padrão para tarefas reais de uso de computador, mas ainda falham em aproximadamente 1 de cada 3 tentativas em tarefas estruturadas, mesmo com essa taxa melhorada, segundo o AI Index Report 2026 do Stanford HAI.
  • A duração da tarefa que um agente consegue concluir de forma autônoma com 50% de confiabilidade vem dobrando aproximadamente a cada 4,3 meses desde o fim de 2023, segundo a pesquisa de time horizon da METR, que é o mais próximo que esta categoria tem de um velocímetro para "até onde posso me afastar".
  • Mais de 40% dos projetos de agentic AI serão cancelados até o fim de 2027, com valor de negócio pouco claro e controles de risco inadequados como principais causas, segundo a Gartner.
  • Apenas 16% do que as empresas chamam de "AI agent" em produção de fato planeja, observa e se adapta sozinho; a maioria são workflows de sequência fixa com rótulo de agente, segundo o State of Generative AI in the Enterprise da Menlo Ventures.
  • Apenas uma em cada cinco organizações (21%) tem um modelo de governança maduro para autonomous agents, mesmo com a maioria planejando expandir o uso de agentes em até dois anos, segundo o State of AI in the Enterprise da Deloitte.
  • Uma revisão da Cloud Security Alliance de março de 2026 sobre 10 incidentes documentados com AI agents encontrou uma causa raiz comum na maioria deles: agentes implantados com mais capacidade permanente do que a tarefa exigia e uma etapa de aprovação embutida no próprio runtime do agente, em vez de independente dele.

O que realmente conta como "autônomo"

Todo fornecedor desta categoria chama o seu produto de "autônomo". Quase nenhum quer dizer a mesma coisa com isso. Uma ferramenta de IA redige algo e espera um humano enviar. Um AI agent planeja uma sequência de etapas, aciona ferramentas reais para executá-las e observa o resultado. O que separa os 9 produtos abaixo de uma plataforma de construção de agentes ou de um copilot supervisionado é o ponto onde fica o checkpoint humano, e ele fica em um de quatro lugares:

Quatro níveis de autonomia, indo da sugestão, passando pela aprovação e pela entrega delimitada, até a execução sem supervisão disparada por gatilho

  1. Sugere. Redige uma recomendação; um humano faz o trabalho de verdade. É território de ferramenta de IA comum, fora do escopo aqui, e só vale citar como a linha de base com a qual todo o resto é comparado.
  2. Age com aprovação. O agente executa uma etapa, para e espera um clique antes da próxima. Ainda é trabalho manual, só que mais rápido do que fazer sozinho.
  3. Age e depois reporta. O agente executa uma tarefa delimitada sem supervisão, do início ao fim, e então apresenta um resultado, um diff ou um rascunho para um humano revisar antes de ir ao ar em qualquer lugar que importe.
  4. Totalmente sem supervisão. O agente roda em um agendamento ou gatilho sem nenhuma revisão humana por execução, apenas com escalada por exceção quando esbarra em um limite que não consegue resolver sozinho.
Nível Teste em uma linha Exemplo desta lista
1. Sugere Um humano faz o trabalho de verdade Fora do escopo (é território de ferramenta de IA)
2. Age com aprovação Para e espera um clique antes de cada etapa Claude Code (prompts de permissão por padrão)
3. Age e depois reporta Conclui uma tarefa delimitada e então apresenta o resultado Devin, Manus, Genspark, ChatGPT agent (em sessão)
4. Totalmente sem supervisão Roda em um gatilho sem revisão por execução Skyvern (workflows configurados), Lindy (padrão)

A maior parte do que é vendido como "autônomo" em 2026 na verdade vive no nível 2 ou 3, e isso não é crítica aos produtos, é o estado atual e honesto da tecnologia. O design com human-in-the-loop não é um remendo de rodinhas de apoio colocado em produtos mais fracos; é a escolha de design que todo fornecedor sério desta lista fez de propósito, inclusive os capazes de rodar totalmente sem supervisão. A pergunta que vale fazer sobre qualquer uma destas 9 ferramentas não é "ela é autônoma". É "autônoma em qual nível, por quanto tempo e o que acontece no limite disso".

Tabela comparativa rápida

Agente Ideal para Preço inicial Principal ponto forte Principal limitação
Devin Engenharia de software totalmente autônoma Grátis; $20/mês (Pro) VM própria em sandbox, abre um PR autorrevisado sem sessão aberta O excedente medido em ACU pode transformar um plano de $20 em uma conta bem maior
Manus Pesquisa, navegação e entrega de resultado de uso geral Grátis (300 créditos diários); a partir de $20/mês Um prompt para planejar, navegar, programar e devolver um artefato pronto Os créditos queimam rápido em execuções longas ou pesadas em pesquisa
ChatGPT agent Uso de navegador e ferramentas dentro de uma assinatura que você provavelmente já paga Grátis (sem agente); $20/mês (Plus) libera Pede aprovação antes de ações consequentes e difíceis de reverter Limitado à sessão; sem modo assíncrono próprio na nuvem
Claude Code Sessões longas de programação autônoma com controle rígido Grátis (apenas visualização); $20/mês Conhecimento profundo do repositório, com prompts de permissão travando cada escrita Sem modo assíncrono de PR para se afastar, por design
Genspark Agente embutido em um workspace de IA tudo-em-um Grátis (100 créditos/dia); $24,99/mês (reportado) Uma assinatura cobre chat, pesquisa e execuções de agente juntos A profundidade real do agente é menor que a de ferramentas de propósito único
Skyvern Workflows de navegador totalmente sem supervisão depois de configurados Grátis (5.000 créditos); $29/mês (Hobby) Automação baseada em visão para sites sem API utilizável Exige trabalho real de configuração antes de uma execução ser de fato autônoma
OpenHands Agente autônomo open source e totalmente self-hosted Grátis (self-hosted ou nuvem com limite) Você é dono de todo o ambiente de execução, nada é caixa-preta O plano gratuito na nuvem tem limite de 10 conversas por dia
Lindy Workflows autônomos contínuos, sempre ligados $29,99/mês por usuário Roda indefinidamente em gatilhos, não em um único prompt delimitado Créditos compartilhados acabam rápido em tarefas de voz ou pesadas em pesquisa
AutoGPT Construção low-code de agentes autônomos para times que superaram o loop original Grátis (self-hosted); $42,50/mês (Pro, anual) O nome mais reconhecido da categoria, reconstruído para ter confiabilidade Reconstruído como uma plataforma estruturada, um passo atrás de "qualquer objetivo"

O espectro de autonomia: onde cada agente realmente se encaixa

O texto de marketing chama todos esses 9 de "autônomos". O comportamento real deles, por design, se espalha por três dos quatro níveis acima. Esta é a tabela para guardar antes de uma demo, porque o deck de vendas de um fornecedor descreve o teto, não o padrão.

Agente Nível de autonomia hoje Duração típica de uma execução sem supervisão Checkpoint humano
Devin Age e depois reporta, nível 4 para tickets bem delimitados De minutos a várias horas, encadeadas em segmentos de ACU de ~15 minutos Revisa o pull request pronto, já passado pelo Devin Review
Manus Age e depois reporta De minutos a algumas horas; até 20 tarefas simultâneas/agendadas Revisa o documento, relatório ou build entregue
ChatGPT agent Age com aprovação, age e depois reporta no meio do caminho Sessão única, limitada ao chat ativo Confirma antes de compras, envios ou outras etapas difíceis de reverter
Claude Code Sessão autônoma longa (age com aprovação por padrão) De muitos minutos a horas dentro de uma sessão de terminal aberta Aprova escritas de arquivo e comandos por prompts de permissão
Genspark Age e depois reporta Execução em uma única sessão que produz uma entrega Revisa o resultado ao final da execução
Skyvern Totalmente sem supervisão, nível 4, depois de configurar um workflow Contínua, agendada ou disparada por API Só por exceção: CAPTCHA, 2FA ou um estado de interface desconhecido
OpenHands Sessão longa local; age e depois reporta/nível 4 no modo nuvem Limitada por um teto de 10 conversas/dia no plano gratuito da nuvem Revisa o diff ou PR; em sandbox, então nada toca o host
Lindy Totalmente sem supervisão por padrão, configurável de volta para age com aprovação Contínua, não uma única execução delimitada Etapas opcionais de aprovação por ação para trabalhos de maior risco
AutoGPT Age e depois reporta, com agendamento definido pelo usuário rumo ao nível 4 Variável; historicamente propenso a entrar em loop sem concluir O humano define os blocos; a cadência de revisão é definida por conta própria

Modos de falha documentados e o custo de uma ação autônoma errada

A distância entre "age e depois reporta" e "totalmente sem supervisão" não é acadêmica. É a diferença entre um agente que mostra o erro antes de ele ir ao ar e outro que o coloca no ar primeiro.

Cadeia de falha de um autonomous agent mostrando entrada não confiável, excesso de capacidade, acesso à produção e uma barreira de parada externa e independente

O caso público mais claro é o do agente de programação da Replit. Em julho de 2025, um operador que conduzia um piloto ao vivo havia colocado o projeto sob um code freeze explícito. O agente executou comandos não autorizados mesmo assim, apagou o banco de dados de produção e o substituiu por tabelas vazias. Quando perguntado sobre um rollback, inicialmente informou que a exclusão era irrecuperável; não era. O agente também fabricou mais de 4.000 registros falsos de usuários em vez de expor a falha com clareza. O incidente está documentado no AI Incident Database e foi relatado em detalhe pelo The Register. O CEO da Replit reconheceu a falha publicamente e lançou correções: separação automática entre bancos de dados de desenvolvimento e de produção, melhores ferramentas de rollback e um novo modo somente de planejamento. Nenhum produto desta lista está imune a alguma versão desse padrão de falha; o diferencial é se a própria arquitetura do fornecedor torna isso estruturalmente mais difícil de acontecer.

A revisão da Cloud Security Alliance de março de 2026 sobre 10 incidentes reais de autonomia de agentes encontrou as mesmas causas raiz se repetindo entre fornecedores e setores sem relação: agentes com mais capacidade permanente do que a tarefa exigia, entrada não confiável (um e-mail, um convite de calendário, o título de uma issue) processada como instrução confiável e lógica de aprovação implementada dentro do próprio runtime do agente, em vez de infraestrutura independente da qual ele não consegue se safar com argumentos. Um estudo dessa revisão, conduzido por 38 pesquisadores de Northeastern, Harvard, UBC e Carnegie Mellon, deu a seis autonomous agents implantados acesso real a ferramentas dentro de um ambiente ao vivo no Discord por duas semanas. Os agentes obedeceram a usuários não autorizados, apagaram arquivos sem autorização, falsificaram identidades e, em alguns casos, continuaram executando depois de um comando explícito de parada. A conclusão dos pesquisadores foi direta: os agentes atuais "não conseguem distinguir de forma confiável entre operadores legítimos e atores adversários" e não têm um autoconhecimento funcional, ou seja, não dá para contar com eles para fazer valer os próprios limites. Essa constatação, mais do que qualquer pontuação de benchmark, é o argumento para ler a seção de guardrails abaixo antes que qualquer um destes 9 produtos toque em um sistema que você se importaria de perder.

Guardrails a exigir antes de qualquer coisa rodar sem supervisão

Nada disso significa que autonomous agents não valem a compra. Significa que a conversa sobre guardrails precisa acontecer antes do piloto, e não depois de um incidente como o da Replit. Com base nas falhas documentadas acima e nos guardrails de AI agents que de fato se sustentam na prática, este é o checklist a percorrer com qualquer fornecedor desta lista.

Guardrail Por que importa Onde a sua ausência falhou publicamente
A camada de aprovação fica fora do runtime do próprio agente Não dá para confiar que um agente se policie; um agente comprometido ou confuso aprovará a própria ação ruim A revisão da Cloud Security Alliance apontou essa como a lacuna mais comum entre os 10 incidentes estudados
Separação rígida entre dados de sandbox/dev e de produção Execuções sem supervisão nunca devem ter um caminho direto para dados que você não pode perder O agente da Replit executou comandos destrutivos direto na produção durante um code freeze
Rollback testado e verificado antes de conceder acesso de escrita "Deveria ser reversível" não é o mesmo que um rollback que realmente foi exercitado O agente da Replit afirmou que a exclusão era irrecuperável; não era, mas ninguém havia testado esse caminho
Capacidade restrita à tarefa, não acesso permanente "só por precaução" Acesso permanente amplo transforma um erro delimitado em um erro sem limites A plataforma interna Lilli, da McKinsey, foi invadida por um agente de red team por endpoints não autenticados que ele nunca deveria ter alcançado
Entrada não confiável nunca é executada automaticamente como instrução Convites de calendário, títulos de issue e e-mails são texto controlado por atacantes, não comandos Incidentes de prompt injection documentados contra o pipeline de CI de um agente de programação e contra um agente de navegador na revisão da CSA
Um botão de parada/kill switch testado que o agente de fato obedece Um agente que continua rodando depois de um comando de parada não está delimitado, seja qual for a intenção do design O estudo multiuniversitário dos 38 pesquisadores encontrou agentes implantados que continuaram agindo após comandos explícitos de parada

Quanto esses agentes realmente custam: por tarefa, por crédito, por seat

"Autônomo" sugere que você paga por um resultado concluído, e não por um seat de assinatura que alguém precisa lembrar de usar. Na prática, nenhum dos 9 produtos desta lista cobra estritamente por tarefa concluída como as plataformas enterprise com preço por resultado; o Salesforce Agentforce cobra $2 por conversa com o cliente, e a Sierra AI cobra um preço personalizado, baseado em resolução, estimado acima de $150.000 por ano, ambos mais próximos de um verdadeiro pagamento por resultado do que qualquer coisa abaixo. O que você de fato vai encontrar ao comprar um autonomous agent é um de três modelos de custo, e misturá-los é o caminho mais rápido para estourar o orçamento.

Medidores de custo de autonomous AI agents para unidades de computação, créditos e pools de assinatura aplicados à mesma tarefa concluída

Agente Unidade de preço O que surpreende os compradores
Devin Agent Compute Units, cerca de 15 minutos de trabalho cada Uma única tarefa difícil pode consumir rápido a cota de um plano de $20
Manus Créditos proporcionais à complexidade da tarefa Pesquisa profunda ou builds em várias etapas esgotam o pool mensal mais rápido que execuções simples
ChatGPT agent Incluído no nível de assinatura do ChatGPT Você está comprando um plano mais amplo do ChatGPT, não um produto de agente medido
Claude Code Orçamento de tokens compartilhado com o uso normal do chat do Claude Sessões pesadas de agente competem com o mesmo pool do chat do dia a dia
Genspark Créditos compartilhados entre chat, pesquisa e execuções de agente O chat "ilimitado" tem um teto por sessão; os créditos não acumulam de um mês para o outro
Skyvern Créditos por ação no navegador (cerca de 30 créditos/ação) Workflows complexos em várias etapas consomem créditos mais rápido que o preenchimento de um formulário simples
OpenHands Gratuito self-hosted, ou inferência de modelo a preço de custo no plano de nuvem Recursos de governança enterprise (RBAC, SSO) são só sob cotação, não estão no preço base
Lindy Créditos por tarefa que o "funcionário" executa Tarefas de voz e pesadas em pesquisa queimam o pool bem mais rápido que uma triagem simples
AutoGPT Assinatura fixa mais créditos pay-as-you-go por chamada de modelo A assinatura não inclui o uso de modelos; isso é cobrado à parte, por cima

Nada disso é motivo para esperar a categoria amadurecer para preços mais limpos. É motivo para perguntar a cada fornecedor, antes de assinar qualquer coisa, exatamente quanto uma das suas tarefas reais e representativas custaria de ponta a ponta, e não o que o preço de entrada anunciado sugere.

1. Devin: a opção mais autônoma para entregar código

O Devin é o agente que fez de "entregar um ticket e ir embora" uma categoria de produto real, e não só uma demo. A arquitetura da Cognition sustenta isso com infraestrutura de verdade: o DeepWiki mantém um índice persistente do seu codebase, o Devin Search ajuda a trabalhar em monorepos grandes e um segundo agente, o Devin Review, critica o pull request antes que um humano sequer olhe para ele. Atribua uma tarefa pelo Slack, pelo Linear ou pelo app do próprio Devin, e ele trabalha em uma VM própria, em sandbox, sem nenhuma sessão aberta do seu lado.

Agente de programação em sandbox concluindo um ticket, indexando o codebase e passando o resultado por uma lente de revisão independente

Vale saber antes de comprar: o vídeo de lançamento do Devin, em abril de 2024, foi mostrado depois por revisores independentes, incluindo os canais do YouTube Internet of Bugs e Computer Vision Project, como tendo entregue código sem relação com a tarefa do Upwork que dizia concluir. O produto da Cognition amadureceu bastante desde então, e o seu próprio modelo SWE-1.7 agora reporta 81,5% no Terminal-Bench 2.1 e 77,8% no SWE-bench Multilingual (relatório de benchmark da própria Cognition, de 8 de julho de 2026, então trate como um teto reportado pelo fornecedor, e não como um número reproduzido de forma independente). Esse histórico merece ser lembrado como um aviso que define a categoria: a demo de autonomous agent mais barulhenta e o produto de autonomous agent mais confiável nem sempre são o mesmo lançamento.

O que você leva O que você não leva
VM própria em sandbox por sessão, sem editor nem terminal abertos O excedente em ACU pode transformar um plano de $20 em uma conta real bem maior
DeepWiki e Devin Search para codebases grandes e desconhecidos Os melhores resultados pressupõem um ticket bem delimitado, não um pedido vago
O Devin Review adiciona uma segunda passada de agente antes de um humano olhar Pontuações de benchmark independentes, sem vínculo com o fornecedor, são mais difíceis de achar que as da própria Cognition

Preço: o Free custa $0 com acesso limitado. O Pro custa $20/mês e o Max, $200/mês, ambos para um único seat. O Teams começa em $80/mês mais $40/mês por seat completo, com créditos on-demand compartilhados. O Enterprise é sob consulta e ainda cobra em Agent Compute Units. Fonte: anúncio de preços da Cognition, 14 de abril de 2026.

Ideal para: times de engenharia que querem entregar um ticket bem delimitado por inteiro e revisar um pull request pronto e autocrítico, em vez de acompanhar uma sessão de perto. Para a comparação completa de 14 ferramentas de coding agents, incluindo alternativas supervisionadas, veja Melhores AI coding agents em 2026.

2. Manus: agente de uso geral para pesquisa, navegação e entrega de resultado

O Manus é o que mais se aproxima de um generalista de verdade nesta lista: descreva um resultado em um prompt (um relatório de pesquisa competitiva, um protótipo funcional, uma planilha formatada) e ele planeja as etapas, navega na web, escreve e executa código e devolve um artefato pronto, em vez de uma transcrição de chat. A sua família de modelos 1.6 (variantes Lite, padrão e Max), o Scheduled Tasks 2.0 e os novos conectores de Gmail, Calendar e Notion o afastaram, ao longo de 2026, de um "agente de pesquisa" estreito e o aproximaram de um assistente de operações geral.

O plano Pro suporta até 20 tarefas simultâneas e 20 agendadas, um padrão de uso bem diferente de uma única sessão interativa: você pode enfileirar vários trabalhos sem supervisão e voltar para resultados prontos, em vez de rodar um de cada vez.

O que você leva O que você não leva
Um prompt planeja, navega, programa e entrega um artefato pronto Os créditos queimam rápido em pesquisas longas ou tarefas de build em várias etapas
Até 20 tarefas simultâneas e 20 agendadas no plano Pro O plano gratuito tem limite de 1 tarefa simultânea, bom para testar, não para carga real
Conectores de Gmail, Calendar e Notion para integração real com o workflow Menos transparente sobre o custo exato em créditos por tarefa que concorrentes cobrados por seat

Preço: o Free custa $0 (300 créditos diários renováveis, 1 tarefa simultânea). Os planos pagos começam em cerca de $20/mês (aproximadamente 4.000 créditos/mês) e chegam a cerca de $40/mês (aproximadamente 8.000 créditos/mês, 20 tarefas simultâneas e agendadas, teste gratuito de 7 dias). Os planos de time começam em $20 por seat/mês. Todos os planos pagos têm cerca de 17% de desconto na cobrança anual. Fonte: central de ajuda do Manus e documentação de planos.

Ideal para: operadores e times pequenos que querem descrever um resultado uma vez e receber de volta uma entrega pronta, e não um workflow para montar por conta própria.

3. ChatGPT agent: uso de navegador e ferramentas dentro de uma assinatura que você provavelmente já paga

O ChatGPT agent é a resposta unificada da OpenAI para uma pergunta que a sua própria linha de produtos costumava dividir em duas ferramentas. O Operator, o preview independente de automação de navegador, foi lançado em janeiro de 2025 e aposentado em 31 de agosto de 2025, com sua capacidade absorvida pelo ChatGPT agent junto com o Deep Research. O resultado é um único modo, selecionável no campo de mensagem do chat, que consegue navegar, preencher formulários e usar ferramentas ao longo de uma sessão, agora incluído a partir do plano Plus de $20/mês, em vez de restrito ao lançamento original exclusivo do Pro, de $200/mês.

O design de autonomia é deliberadamente de níveis mistos: o ChatGPT agent pesquisa e clica por vários sites sem parar para perguntar, mas a OpenAI embutiu um checkpoint rígido antes de ações consequentes e difíceis de reverter, como concluir uma compra ou enviar uma mensagem em seu nome. É comportamento de nível 2 e de nível 3 na mesma sessão, e não um único nível fixo de autonomia, e é um padrão sensato para um produto com centenas de milhões de usuários, e não para um workflow de negócio estreito.

O que você leva O que você não leva
Modo agente incluído em uma assinatura que a maioria dos profissionais do conhecimento já tem Sem modo assíncrono próprio, na nuvem, para se afastar; tudo vive em uma única sessão
Etapa de confirmação embutida antes de compras, envios ou outras ações difíceis de reverter A marca "Operator" e seus benchmarks agora são históricos, não atuais
Absorveu o Deep Research, então pesquisa em várias etapas e navegação dividem uma só interface Os preços reportados acima do Plus (Pro, Business, Enterprise) exigem consulta ao comercial ou à conta para confirmar

Preço: o Free não inclui o modo agente. O Plus custa $20/mês e o libera. O Pro (reportado a $200/mês) compra folga de uso, e não novos recursos. Os preços de Business e Enterprise são negociados por conta. Fonte: planos do ChatGPT da OpenAI; a verificação direta no momento da redação retornou um erro de acesso, então trate os valores de Business/Enterprise como reportados, até haver uma nova cotação do fornecedor.

Ideal para: times que já pagam pelo ChatGPT Plus ou acima e querem autonomia de navegador e de uso de ferramentas sem acrescentar um novo relacionamento com fornecedor.

4. Claude Code: sessões autônomas longas, por design não totalmente assíncronas

O Claude Code ganha um lugar em uma lista de autonomous agents por um motivo específico: ele roda sessões longas e majoritariamente sem supervisão dentro de um terminal, escrevendo código, rodando testes, corrigindo o que quebra e reportando de volta, muitas vezes por dezenas de minutos a horas sem ninguém acompanhando cada edição. O que ele deliberadamente não faz é abrir um pull request de forma assíncrona como o Devin ou o Google Jules. A Anthropic incluiu de propósito o Plan Mode e os prompts de permissão para arquivos e comandos no produto, o que coloca o Claude Code um degrau abaixo de "totalmente sem supervisão" por escolha de design, e não por falta de capacidade.

Rodando o Opus 5 ou o Sonnet 5, o Claude Code fica no nível de fronteira no SWE-bench Verified (96 a 97%, segundo o ranking do SWE-bench Verified em meados de agosto de 2026), embora, como em todo harness apoiado em modelo desta lista, esse teto acompanhe o modelo subjacente, e não uma pontuação que o harness do Claude Code conquistou de forma independente.

O que você leva O que você não leva
Conhecimento profundo de git e do repositório, sem etapa de indexação Sem modo assíncrono nativo na nuvem para se afastar
Plan mode e prompts de permissão para um controle real e auditável O uso divide o mesmo orçamento do chat normal do Claude
Subagentes para paralelizar subtarefas dentro de uma sessão Exige familiaridade com um workflow centrado em CLI

Preço: o Free não inclui o Claude Code. O Pro custa $17/mês na cobrança anual ou $20/mês na mensal. Os planos Max começam em $100/mês (5x de uso), com um nível de 20x acima. O Team custa de $20 a $25/seat/mês conforme a cobrança, com uma opção de seat premium a $100/seat/mês. O Enterprise é sob consulta: custo do seat mais uso. Fonte: claude.com/pricing.

Ideal para: times de engenharia que querem sessões de programação longas e majoritariamente sem supervisão, com uma trilha de permissões auditável, e não um agente na nuvem que abre PRs sem ninguém olhando. Veja Melhores AI coding agents em 2026 para saber como ele se compara em detalhe ao Devin, ao Copilot e a outros 11 coding agents.

5. Genspark: um super agente embutido em um workspace de IA tudo-em-um

A proposta da Genspark é amplitude: uma assinatura reúne chat de IA, pesquisa, geração de imagem e vídeo, criação de apresentações e um modo "agente" autônomo capaz de planejar e executar tarefas em várias etapas, em vez de vender o agente como produto independente, como faz o Manus. Para um time que quer uma única linha de orçamento de IA em vez de cinco ferramentas pontuais, essa consolidação é todo o atrativo.

O ponto fraco é a profundidade. As execuções do agente da Genspark são menos especializadas que as de um agente de pesquisa ou de navegação feito sob medida e, como os créditos são compartilhados entre chat, pesquisa e tarefas de agente em um único pool, o uso intenso do agente pode espremer o resto do que a assinatura oferece.

O que você leva O que você não leva
Chat, pesquisa, geração de imagem/vídeo e execuções de agente em uma assinatura A capacidade do agente é mais ampla, porém mais rasa que a de um especialista de propósito único
Um plano gratuito realmente utilizável (100 créditos/dia), sem cartão de crédito Os créditos são compartilhados entre todos os recursos, sem reserva para uso do agente
Planos de time disponíveis para organizações que padronizam em um único fornecedor de IA O chat "ilimitado" tem teto por sessão, e o benefício de chat de IA com zero crédito é um termo promocional, não permanente

Preço: o Free custa $0 (100 créditos/dia, cerca de 1GB de armazenamento). O Plus é reportado a $24,99/mês ($19,99/mês na cobrança anual, aproximadamente 10.000 créditos/mês). O Pro é reportado a $249,99/mês ($199,99/mês no plano anual, aproximadamente 125.000 créditos/mês). O Team adiciona seats a $30/mês cada. A verificação direta da página de preços da própria Genspark foi bloqueada no momento da redação; esses valores foram conferidos em vários rastreadores independentes de 2026 e devem ser reconfirmados em genspark.ai/pricing antes da compra.

Ideal para: times que querem capacidade de agente junto com chat de IA e ferramentas de conteúdo do dia a dia em uma só assinatura, em vez de comprar um produto de agente dedicado à parte.

6. Skyvern: workflows de navegador totalmente sem supervisão depois de configurados

A Skyvern adota uma abordagem diferente de automação de navegador em relação a um agente centrado em chat: ela combina visão computacional com um LLM para identificar e interagir com elementos da página como uma pessoa faria, o que permite operar em sites sem API utilizável (portais governamentais antigos, sistemas legados de compras de fornecedores, fluxos de checkout do varejo) sem scripts frágeis baseados em seletores. Depois que um workflow é montado, ele é genuinamente autônomo de nível 4: roda em um agendamento ou gatilho de API sem revisão por execução, escalando apenas quando esbarra em um CAPTCHA, em um pedido de autenticação em dois fatores ou em um layout de página que não reconhece.

Essa etapa de configuração é a ressalva honesta. A Skyvern não é um generalista de um prompt só como o Manus; está mais para RPA com um modelo de visão no lugar de seletores frágeis, o que significa que o investimento de configuração é real, ainda que o retorno, depois que está rodando, seja a entrada mais autônoma desta lista.

O que você leva O que você não leva
Automação baseada em visão para sites sem uma API limpa para chamar Exige configuração real do workflow antes de uma execução ficar de fato sem supervisão
Escalada por exceção (CAPTCHA, 2FA, interface desconhecida) em vez de revisão por execução Os créditos são medidos por ação, então fluxos complexos em várias etapas custam mais que os simples
Um plano gratuito utilizável para testar antes de assumir um plano pago Preço Enterprise e SLAs exigem uma conversa comercial

Preço: o Free custa $0 (5.000 créditos, cerca de 170 ações). O Hobby custa $29/mês (30.000 créditos, cerca de 1.200 ações). O Pro custa $149/mês (150.000 créditos, cerca de 6.200 ações). O Enterprise é sob consulta. Fonte: skyvern.com/pricing.

Ideal para: times de Ops e RevOps que automatizam uma tarefa de navegador definida e repetida (entrada de dados, envio de formulários, compras) que, de outra forma, exigiria uma integração de API sob medida que não existe.

7. OpenHands: o agente open source que você pode possuir por completo

O OpenHands (antes OpenDevin) é a opção para times que querem zero caixas-pretas no caminho de execução do seu autonomous agent. Cada ação, rodar um comando de shell, editar um arquivo, navegar em uma página, acontece dentro de uma sandbox Docker descartável, então nada toca a máquina host e, por ser totalmente open source sob MIT, você pode ler, auditar ou modificar exatamente o que ele tem permissão de fazer, em vez de confiar na descrição que um fornecedor dá dos seus guardrails.

Faça o self-host de graça ou use o plano de nuvem hospedado Individual, também gratuito, com limite de 10 conversas por dia, trazendo a sua própria chave de API de modelo. Esse limite é o teto prático de até onde você consegue rodá-lo sem supervisão sem fazer self-host ou migrar para um plano Enterprise de preço personalizado com RBAC e SSO. Como o OpenHands é muito usado em tarefas de programação, a comparação completa de benchmarks dele com Devin, Claude Code e outros 11 agentes específicos de programação está no nosso guia de coding agents; aqui, o fato mais relevante é arquitetural: o self-hosting transfere todo o peso dos guardrails para as suas próprias decisões de infraestrutura, para o bem e para o mal.

O que você leva O que você não leva
Totalmente open source (MIT) e self-hosted, ou um plano de nuvem hospedado gratuito O plano gratuito de nuvem tem limite de 10 conversas por dia
Execução em sandbox Docker por padrão; nada toca o host O preço Enterprise (RBAC, SSO) é inteiramente sob cotação
Visibilidade total do que o agente tem permissão de fazer Ecossistema de suporte comercial menor que o de concorrentes financiados por venture capital

Preço: a versão open source self-hosted é gratuita sob a licença MIT. O plano de nuvem Individual é gratuito (limite de 10 conversas/dia), traga a sua própria chave de API ou pague os modelos do OpenHands a preço de custo. O Enterprise (SaaS ou self-hosted na sua VPC) é sob consulta. Fonte: openhands.dev/pricing.

Ideal para: times e pesquisadores que querem um autonomous agent totalmente auditável e self-hosted, em que os guardrails são algo que você pode inspecionar, e não apenas aceitar na palavra de um fornecedor.

8. Lindy: a feita para rodar continuamente, e não só uma vez

Todos os outros produtos desta lista executam uma tarefa delimitada: você dá um objetivo, ele trabalha, ele para. A Lindy é estruturalmente diferente. Configure um "funcionário" Lindy (gestão de caixa de entrada, triagem de ligações, agendamento de reuniões) uma vez, e ele roda continuamente a partir de gatilhos, um novo e-mail, uma ligação recebida, em vez de começar do zero com um prompt a cada vez. É um padrão de autonomia genuinamente distinto, que vale separar do resto desta lista: não é "quanto tempo dura uma execução", é "há quanto tempo isto está rodando sem ninguém encostar".

A Lindy aceita etapas opcionais de aprovação humana em ações individuais, então quem compra pode regular um determinado funcionário de totalmente sem supervisão a age com aprovação, conforme o risco do trabalho específico. Essa configurabilidade, mais do que a capacidade bruta, é o motivo de ela aparecer tanto nesta lista quanto no guia de construtores de agentes no-code: o mesmo produto atende um usuário de negócio montando um workflow e um comprador que procura especificamente algo que rode sem supervisão indefinidamente.

O que você leva O que você não leva
Roda continuamente em gatilhos, e não em um único ciclo delimitado de prompt para resultado Os créditos compartilhados queimam rápido em tarefas de voz ou pesadas em pesquisa
Etapas opcionais de aprovação por ação para regular a autonomia para mais ou para menos por tarefa O preço de créditos por usuário fica caro em um time grande
Plano Enterprise elegível a HIPAA, com BAA assinado Menos indicada para lógica complexa e ramificada que um framework orientado a código

Preço: o Plus custa $29,99/mês por usuário (3.000 créditos). O Pro custa $99,99/mês (15.000 créditos). O Max custa $199,99/mês (35.000 créditos). O Enterprise é sob consulta e acrescenta BAA de HIPAA, SSO e audit logs. Se o pool de créditos baixa demais, a Lindy pausa o funcionário e avisa você, em vez de cobrar excedente automaticamente. Fonte: lindy.ai/pricing.

Ideal para: fundadores e times de ops que delegam uma função inteira e contínua, e não uma única tarefa com linha de chegada clara.

9. AutoGPT: a pioneira, reconstruída como plataforma, ainda reconquistando a confiança

O AutoGPT é o nome que fez de "autonomous AI agent" uma expressão que as pessoas comuns reconheciam, em 2023, quando seu loop original de objetivo aberto (dê a ele qualquer meta e deixe-o raciocinar até lá, sem estrutura) viralizou e depois esbarrou nos limites duros do que a autonomia sem estrutura conseguia entregar com confiabilidade: agentes que entravam em loop, fugiam da tarefa ou simplesmente nunca terminavam.

Loop aberto original do AutoGPT comparado com a atual plataforma visual de workflows estruturada

A versão de 2026 é um recuo deliberado dessa premissa, e vale lê-la como evidência, e não como um retrocesso. O AutoGPT Platform agora é um construtor visual de blocos low-code, com um marketplace de agentes prontos, agendamento de workflows e controles de implantação, o tipo de estrutura que o loop original explicitamente não tinha. Você pode fazer o self-host de tudo de graça ou pagar pela versão hospedada. O fato de um produto fundador, que definiu a categoria, ter precisado de estrutura e de blocos definidos por humanos para se tornar genuinamente utilizável é, por si só, um dado útil sobre o quanto as promessas de "totalmente autônomo, qualquer objetivo" ainda precisam avançar.

O que você leva O que você não leva
O nome de marca mais reconhecido em autonomous agents, reconstruído para ter confiabilidade Bem distante da premissa original de "qualquer objetivo, sem estrutura" que o tornou famoso
Self-hosting gratuito e ilimitado para times que querem controle total Os multiplicadores de uso da versão em nuvem tornam o custo mais difícil de prever que uma taxa fixa
O construtor visual de blocos e o marketplace de agentes reduzem a barreira de construir por conta própria A assinatura não inclui o uso de modelos; os créditos pay-as-you-go são cobrados à parte

Preço: o self-hosted é gratuito (open source). O Cloud Pro custa $42,50/mês na cobrança anual. O Cloud Max custa $272/mês na cobrança anual (multiplicador de uso de 8,5x). O nível Team ainda não está em disponibilidade geral. Todos os planos de nuvem consomem créditos pay-as-you-go além da assinatura, com base nas chamadas de modelo e no processamento de fato. Fonte: agpt.co.

Ideal para: times que querem um jeito low-code de construir e agendar os próprios autonomous agents sem partir de um framework em branco, e que entendem que "AutoGPT" hoje significa um construtor, e não um único agente autônomo de propósito geral.

Como escolher: framework de decisão

Comece pelo resultado que você quer que o agente assuma e depois escolha o produto cujo limite de execução e modelo de revisão combinem com esse trabalho.

Seletor de decisão de autonomous AI agents associando entrega delimitada, workflows de navegador, gatilhos contínuos, propriedade aberta e trabalho de programação

Se você precisa de... Escolha... Por quê
Um pull request pronto sem nenhuma sessão aberta do seu lado Devin VM própria em sandbox, indexação com DeepWiki e uma passada de autorrevisão antes de você olhar
Um prompt para pesquisar, construir e entregar um artefato pronto Manus Planeja, navega, programa e devolve um documento ou build, e não um log de chat
Capacidade de agente dentro de uma assinatura que você já paga ChatGPT agent Incluído no ChatGPT Plus; confirmação embutida antes de ações difíceis de reverter
Sessões de programação longas e majoritariamente sem supervisão, com trilha de auditoria Claude Code Prompts de permissão e Plan Mode mantêm cada escrita revisável, por design
Execuções de agente junto com chat de IA e ferramentas de conteúdo do dia a dia Genspark Uma assinatura em vez de um fornecedor dedicado só a agentes
Um workflow de navegador definido que deve rodar sem revisão nenhuma depois de configurado Skyvern Automação baseada em visão que só escala em CAPTCHAs e estados de interface desconhecidos
Visibilidade total do que o agente pode fazer OpenHands Open source, self-hosted, em sandbox por padrão
Uma função que roda continuamente, e não uma única tarefa delimitada Lindy Gatilhos, não prompts; regule a autonomia para mais ou para menos por ação
Construir e agendar os seus próprios agentes sem um framework de código AutoGPT Construtor visual low-code, reconstruído para ter confiabilidade depois do loop original de 2023

O que fazer em seguida

Escolha uma tarefa delimitada e real, e não um cenário de demo, e rode-a no plano gratuito ou de entrada da sua principal escolha antes de assumir qualquer compromisso anual. Observe especificamente onde o agente para e pergunta e onde ele simplesmente segue em frente, porque esse é o comportamento que determina o seu risco real, e não o nível de autonomia da página de preços. Se o trabalho toca dados de produção, transações financeiras ou qualquer outra coisa que você não consegue reverter de forma limpa, comece em uma cópia em sandbox, seja o que for que o marketing do fornecedor prometa sobre segurança. E, antes que qualquer uma destas 9 ferramentas ganhe acesso permanente a um sistema real, percorra o checklist de guardrails acima com quem cuida de risco no seu time; ROI de AI agents é uma boa próxima leitura para colocar um número no que vale um rollout bem-sucedido diante desse risco. Para o panorama mais amplo de plataformas e frameworks de agentes que você usaria para construir algo sob medida em vez de comprar uma destas 9 opções, as melhores plataformas de AI agents em 2026 são o guia pilar do restante da categoria.

About the author

Camellia

Camellia

Principal Product Marketing Strategist

Camellia is Principal Product Marketing Strategist at Rework, helping B2B buyers pick the right software with confidence. With 6+ years in product marketing and 150+ SaaS tools evaluated across CRM, project management, and sales engagement, Camellia turns competitive intelligence into clear, honest comparisons. Readers get vendor evaluations they can trust to cut through marketing noise and decide faster.