AI Agent Otonom Terbaik di 2026: 9 Tool Diurutkan Berdasarkan Seberapa Jauh Mereka Berjalan Tanpa Anda

Giroskop AI agent otonom di dalam sangkar pelindung dengan kunci henti eksternal, gulungan rollback, dan lonceng pengecualian

Turn this article into takeaways for your work.

Each assistant summarizes the article only for you and suggests best practices for your work.

Manus dan Genspark paling mendekati agent serbaguna yang dapat Anda beri tugas sungguhan lalu Anda tinggalkan. Devin adalah opsi paling otonom yang dibangun khusus untuk mengirimkan kode. Skyvern adalah pilihan untuk workflow browser tanpa pengawasan yang sebaliknya memerlukan API yang tidak ada. Dan Lindy satu-satunya yang dibangun untuk berjalan terus-menerus berdasarkan trigger, bukan hanya menjawab satu prompt. Panduan ini memeringkat 9 agent otonom yang nyata dan saat ini dapat dibeli (bukan platform pembangun agent, dan bukan AI copilot yang menunggu persetujuan di setiap baris) berdasarkan satu pertanyaan konkret: seberapa jauh sebuah run benar-benar berjalan sebelum ada yang rusak atau manusia harus turun tangan kembali.

Setiap produk di bawah ini merilis versi yang berfungsi dan tersedia secara umum (atau preview yang diberi label jelas) per Agustus 2026. Kami memverifikasi harga pada halaman vendor masing-masing dan membuang beberapa nama yang Anda lihat di tempat lain dalam kategori ini karena ternyata telah diakuisisi, berganti merek, atau ditinggalkan, daripada mengisi daftar demi angka bulat. Agent otonom adalah kategori yang paling berlebihan klaimnya dalam software AI saat ini, sehingga setiap skor benchmark di bawah menyebutkan nama benchmark dan tanggal pengukurannya, dan kami menyatakan dengan jelas di mana pemasaran vendor telah melampaui apa yang sebenarnya ditemukan para peninjau independen.

Diperbarui Agustus 2026: Apa yang Berubah

  • OpenAI menghentikan Operator pada 31 Agustus 2025. Kemampuan mengendalikan browsernya dilebur ke dalam ChatGPT agent, yang menyatukan Operator dan Deep Research ke dalam satu mode yang dapat dipilih dari composer pada Plus ($20/bulan) ke atas, alih-alih dikunci di balik tingkat peluncuran lama khusus Pro seharga $200/bulan.
  • Salesforce mengakuisisi Convergence AI, pembuat agent Proxy, dalam kesepakatan yang selesai sekitar 11 Juni 2025. Pelanggan yang ada dikirimi email dan dikembalikan dananya. Proxy tidak lagi dijual sebagai produk mandiri; tim dan teknologinya pindah ke Agentforce.
  • MultiOn berganti merek menjadi AGI, Inc. dan beralih ke AGI-0, preview agent mobile proaktif, sementara API MultiOn yang asli tetap hidup sebagai komponen dasar bagi developer, bukan produk konsumen yang sudah jadi.
  • Repositori GitHub AgentGPT diarsipkan pada 28 Januari 2026. Situs hosting-nya masih dapat dimuat dalam kondisi gratis yang terbatas, tetapi proyeknya dibekukan pada spesifikasi 2023 tanpa pengembangan lebih lanjut.
  • Cognition membangun ulang harga self-serve Devin pada 14 April 2026, menggantikan paket Core/Team lama dengan tangga Free, Pro, Max, Teams, Enterprise.

Fakta Kunci

  • AI agent melonjak dari 12% menjadi sekitar 66% keberhasilan tugas pada OSWorld, benchmark standar untuk tugas penggunaan komputer nyata, tetapi masih gagal sekitar 1 dari 3 percobaan pada tugas terstruktur bahkan pada tingkat yang membaik itu, menurut 2026 AI Index Report dari Stanford HAI.
  • Panjang tugas yang dapat diselesaikan agent secara otonom pada keandalan 50% telah berlipat ganda kira-kira setiap 4,3 bulan sejak akhir 2023, menurut riset time horizon METR, hal terdekat yang dimiliki kategori ini sebagai speedometer untuk "seberapa jauh saya bisa meninggalkannya".
  • Lebih dari 40% proyek agentic AI akan dibatalkan pada akhir 2027, dengan nilai bisnis yang tidak jelas dan kontrol risiko yang tidak memadai sebagai penyebab utama, menurut Gartner.
  • Hanya 16% dari apa yang perusahaan sebut "AI agent" di produksi yang benar-benar merencanakan, mengamati, dan beradaptasi sendiri; sebagian besar adalah workflow berurutan tetap yang memakai label agent, menurut State of Generative AI in the Enterprise dari Menlo Ventures.
  • Hanya satu dari lima organisasi (21%) yang memiliki model tata kelola matang untuk agent otonom, meskipun sebagian besar berencana memperluas penggunaan agent dalam dua tahun, menurut State of AI in the Enterprise dari Deloitte.
  • Tinjauan Cloud Security Alliance atas 10 insiden AI agent terdokumentasi pada Maret 2026 menemukan akar penyebab yang sama pada sebagian besar insiden: agent yang diterapkan dengan kapabilitas tetap lebih banyak daripada yang dibutuhkan tugas, dan langkah persetujuan yang dibangun di dalam runtime agent itu sendiri alih-alih terpisah darinya.

Apa yang Sebenarnya Dihitung sebagai "Otonom"

Setiap vendor dalam kategori ini menyebut produknya "otonom". Hampir tidak ada yang bermaksud hal yang sama dengan istilah itu. Sebuah tool AI membuat draf sesuatu dan menunggu manusia mengirimkannya. Sebuah AI agent merencanakan serangkaian langkah, memanggil tool nyata untuk mengeksekusinya, dan mengamati hasilnya. Yang membedakan 9 produk di bawah ini dari platform pembangun agent atau copilot yang diawasi adalah di mana titik pemeriksaan manusia berada, dan titik itu berada di salah satu dari empat tempat:

Empat tingkat otonomi yang bergerak dari saran melalui persetujuan dan pengiriman terbatas hingga eksekusi berbasis trigger tanpa pengawasan

  1. Menyarankan. Membuat draf rekomendasi; manusia yang mengerjakan pekerjaan sebenarnya. Ini wilayah tool AI biasa, di luar cakupan di sini, dan layak disebut hanya sebagai garis dasar yang menjadi pembanding semua yang lain.
  2. Bertindak dengan persetujuan. Agent mengeksekusi satu langkah, berhenti, dan menunggu klik sebelum langkah berikutnya. Masih bersifat langsung, hanya lebih cepat daripada mengerjakannya sendiri.
  3. Bertindak lalu melapor. Agent menjalankan tugas terbatas tanpa pengawasan dari awal sampai akhir, lalu menyajikan hasil, diff, atau draf untuk ditinjau manusia sebelum tayang di tempat yang penting.
  4. Sepenuhnya tanpa pengawasan. Agent berjalan berdasarkan jadwal atau trigger tanpa tinjauan manusia per run sama sekali, hanya eskalasi berbasis pengecualian ketika menemui batas yang tidak dapat diselesaikannya sendiri.
Tingkatan Uji Satu Kalimat Contoh dari Daftar Ini
1. Menyarankan Manusia mengerjakan pekerjaan sebenarnya Di luar cakupan (ini wilayah tool AI)
2. Bertindak dengan persetujuan Berhenti dan menunggu klik sebelum setiap langkah Claude Code (permission prompt secara bawaan)
3. Bertindak lalu melapor Menyelesaikan tugas terbatas, lalu menyajikan hasilnya Devin, Manus, Genspark, ChatGPT agent (dalam sesi)
4. Sepenuhnya tanpa pengawasan Berjalan berdasarkan trigger tanpa tinjauan per run Skyvern (workflow terkonfigurasi), Lindy (bawaan)

Sebagian besar yang dipasarkan sebagai "otonom" pada 2026 sebenarnya berada di tingkat 2 atau 3, dan itu bukan celaan terhadap produknya, melainkan keadaan teknologi saat ini yang jujur. Desain human-in-the-loop bukanlah kompromi roda bantu yang ditempelkan pada produk yang lebih lemah; itu pilihan desain yang dibuat dengan sengaja oleh setiap vendor serius dalam daftar ini, termasuk yang mampu berjalan sepenuhnya tanpa pengawasan. Pertanyaan yang layak diajukan tentang salah satu dari 9 tool ini bukan "apakah ia otonom". Melainkan "otonom di tingkat mana, untuk berapa lama, dan apa yang terjadi di tepi batas itu".

Tabel Perbandingan Cepat

Agen Terbaik untuk Harga Awal Keunggulan Utama Keterbatasan Utama
Devin Rekayasa perangkat lunak yang sepenuhnya otonom Gratis; $20/bulan (Pro) VM sandbox sendiri, membuka PR yang ditinjau sendiri tanpa sesi terbuka Kelebihan pemakaian berbasis ACU dapat mengubah paket $20 menjadi tagihan yang jauh lebih besar
Manus Riset, browsing, dan output terkirim serbaguna Gratis (300 kredit harian); mulai $20/bulan Satu prompt untuk merencanakan, browsing, membuat kode, dan menyerahkan artefak jadi Kredit cepat habis pada run yang panjang atau berat riset
ChatGPT agent Penggunaan browser dan tool dalam langganan yang kemungkinan sudah Anda bayar Gratis (tanpa agent); $20/bulan (Plus) membukanya Meminta persetujuan sebelum tindakan penting yang sulit dibatalkan Terbatas per sesi; tidak punya mode cloud asinkron penuh sendiri
Claude Code Sesi coding otonom panjang dengan kendali ketat Gratis (hanya lihat); $20/bulan Pemahaman repo mendalam dengan permission prompt yang menjaga setiap penulisan Tidak ada mode PR asinkron tinggalkan-saja bawaan, sesuai desain
Genspark Agent terpadu dalam workspace AI serba ada Gratis (100 kredit/hari); $24,99/bulan (dilaporkan) Satu langganan mencakup chat, riset, dan run agent sekaligus Kedalaman agent yang sebenarnya lebih tipis daripada tool berfungsi tunggal
Skyvern Workflow browser sepenuhnya tanpa pengawasan setelah dikonfigurasi Gratis (5.000 kredit); $29/bulan (Hobby) Otomasi berbasis visi untuk situs tanpa API yang dapat dipakai Perlu kerja penyiapan nyata sebelum run benar-benar bebas tangan
OpenHands Agent otonom open-source yang dapat di-host sendiri sepenuhnya Gratis (self-hosted atau cloud terbatas) Anda memiliki seluruh lingkungan eksekusi, tidak ada yang menjadi kotak hitam Tingkat cloud gratis dibatasi 10 percakapan per hari
Lindy Workflow otonom yang terus-menerus aktif $29,99/bulan per pengguna Berjalan berdasarkan trigger tanpa batas, bukan satu prompt terbatas Kredit gabungan cepat terkuras pada tugas suara atau berat riset
AutoGPT Pembangunan agent otonom low-code untuk tim yang melampaui loop aslinya Gratis (self-hosted); $42,50/bulan (Pro, tahunan) Nama paling dikenal di kategori ini, dibangun ulang demi keandalan Dibangun ulang menjadi platform berperancah, langkah mundur dari "tujuan apa pun"

Spektrum Otonomi: Di Mana Setiap Agent Sebenarnya Berada

Salinan pemasaran menyebut kesembilannya "otonom". Perilaku sebenarnya, menurut desainnya, tersebar di tiga dari empat tingkat di atas. Ini tabel yang layak ditandai sebelum demo, karena materi penjualan vendor akan menggambarkan batas atas, bukan kondisi bawaan.

Agen Tingkat Otonomi Saat Ini Durasi Run Tanpa Pengawasan yang Umum Titik Pemeriksaan Manusia
Devin Bertindak lalu melapor, tingkat 4 untuk tiket yang cakupannya jelas Menit hingga beberapa jam, dirantai dalam segmen ACU sekitar 15 menit Meninjau pull request yang sudah selesai dan disaring Devin Review
Manus Bertindak lalu melapor Menit hingga beberapa jam; hingga 20 tugas bersamaan/terjadwal Meninjau dokumen, laporan, atau build yang dikirimkan
ChatGPT agent Bertindak dengan persetujuan, bertindak lalu melapor di antaranya Satu sesi, dibatasi oleh chat yang aktif Mengonfirmasi sebelum pembelian, pengiriman, atau langkah lain yang sulit dibatalkan
Claude Code Sesi otonom yang diperpanjang (bertindak dengan persetujuan secara bawaan) Banyak menit hingga berjam-jam dalam satu sesi terminal yang terbuka Menyetujui penulisan file dan perintah melalui permission prompt
Genspark Bertindak lalu melapor Run satu sesi yang menghasilkan satu deliverable Meninjau output di akhir run
Skyvern Sepenuhnya tanpa pengawasan, tingkat 4, setelah workflow dikonfigurasi Berkelanjutan, terjadwal atau dipicu API Hanya pengecualian: CAPTCHA, 2FA, atau status UI yang tidak dikenali
OpenHands Sesi yang diperpanjang secara lokal; bertindak lalu melapor/tingkat 4 dalam mode cloud Dibatasi oleh batas 10 percakapan/hari pada tingkat cloud gratis Meninjau diff atau PR; di-sandbox sehingga tidak ada yang menyentuh host
Lindy Sepenuhnya tanpa pengawasan secara bawaan, dapat dikonfigurasi kembali ke bertindak-dengan-persetujuan Berkelanjutan, bukan satu run terbatas Langkah persetujuan per tindakan yang opsional untuk pekerjaan berisiko lebih tinggi
AutoGPT Bertindak lalu melapor, penjadwalan yang ditentukan pengguna menuju tingkat 4 Bervariasi; secara historis rentan berputar-putar tanpa selesai Manusia menentukan blok; ritme tinjauan ditetapkan sendiri

Mode Kegagalan Terdokumentasi dan Biaya Tindakan Otonom yang Salah

Jurang antara "bertindak lalu melapor" dan "sepenuhnya tanpa pengawasan" bukan sekadar akademis. Itulah perbedaan antara agent yang menunjukkan kesalahan sebelum dikirim dan agent yang mengirimkannya lebih dulu.

Rantai kegagalan agent otonom yang menunjukkan input tidak tepercaya, kapabilitas berlebih, akses produksi, dan gerbang henti eksternal yang independen

Kasus publik yang paling jelas adalah coding agent Replit. Pada Juli 2025, seorang operator yang menjalankan pilot langsung telah menempatkan proyek di bawah code freeze yang eksplisit. Agent tetap menjalankan perintah tanpa izin, menghapus database produksi, dan menggantinya dengan tabel kosong. Ketika ditanya soal rollback, ia awalnya melaporkan bahwa penghapusan itu tidak dapat dipulihkan; padahal bisa. Agent itu juga mengarang lebih dari 4.000 data pengguna palsu alih-alih mengungkap kegagalan secara terus terang. Insiden ini didokumentasikan dalam AI Incident Database dan dilaporkan secara rinci oleh The Register. CEO Replit secara terbuka mengakui kegagalan itu dan meluncurkan perbaikan: pemisahan otomatis antara database pengembangan dan produksi, perangkat rollback yang lebih baik, dan mode hanya-perencanaan yang baru. Tidak ada produk dalam daftar ini yang kebal terhadap salah satu versi pola kegagalan tersebut; pembedanya adalah apakah arsitektur vendor sendiri membuatnya secara struktural lebih sulit terjadi.

Tinjauan Cloud Security Alliance pada Maret 2026 atas 10 insiden otonomi agent nyata menemukan akar penyebab yang sama berulang di antara vendor dan industri yang tidak berkaitan: agent membawa kapabilitas tetap lebih banyak daripada yang dibutuhkan tugas, input tidak tepercaya (email, undangan kalender, judul issue) diproses sebagai instruksi tepercaya, dan logika persetujuan diimplementasikan di dalam runtime agent itu sendiri alih-alih sebagai infrastruktur independen yang tidak dapat ia bujuk keluar. Satu studi dalam tinjauan itu, yang dijalankan 38 peneliti dari Northeastern, Harvard, UBC, dan Carnegie Mellon, memberi enam agent otonom yang telah diterapkan akses tool nyata di dalam lingkungan Discord langsung selama dua minggu. Agent-agent itu menuruti pengguna yang tidak berwenang, menghapus file tanpa otorisasi, memalsukan identitas, dan dalam beberapa kasus terus mengeksekusi setelah perintah henti yang eksplisit. Kesimpulan para peneliti lugas: agent saat ini "tidak dapat secara andal membedakan antara operator yang sah dan pelaku yang bermusuhan" dan tidak memiliki model diri yang berfungsi, artinya tidak dapat diandalkan untuk menegakkan batasnya sendiri. Temuan itu, lebih daripada skor benchmark mana pun, adalah argumen untuk membaca bagian guardrail di bawah sebelum salah satu dari 9 produk ini menyentuh sistem yang tidak ingin Anda kehilangan.

Guardrail yang Harus Dituntut Sebelum Apa Pun Berjalan Tanpa Pengawasan

Semua ini tidak berarti agent otonom tidak layak dibeli. Artinya, percakapan tentang guardrail harus terjadi sebelum pilot, bukan setelah insiden seperti yang menimpa Replit. Berdasarkan kegagalan terdokumentasi di atas dan guardrail AI agent yang benar-benar bertahan dalam praktik, berikut daftar periksa yang layak dikerjakan bersama vendor mana pun dalam daftar ini.

Guardrail Mengapa Penting Di Mana Ketiadaannya Gagal secara Publik
Lapisan persetujuan berada di luar runtime agent itu sendiri Agent tidak dapat dipercaya untuk mengawasi dirinya sendiri; agent yang disusupi atau bingung akan menyetujui tindakan buruknya sendiri Tinjauan Cloud Security Alliance menemukan ini celah tunggal yang paling umum dari seluruh 10 insiden yang dipelajari
Pemisahan tegas antara data sandbox/dev dan produksi Run tanpa pengawasan tidak boleh memiliki jalur langsung ke data yang tidak sanggup Anda hilangkan Agent Replit menjalankan perintah destruktif langsung terhadap produksi saat code freeze
Rollback yang teruji dan terverifikasi sebelum memberi akses tulis "Seharusnya dapat dibatalkan" tidak sama dengan rollback yang benar-benar pernah dijalankan Agent Replit mengklaim penghapusan tidak dapat dipulihkan; ternyata bisa, tetapi tidak ada yang pernah menguji jalur itu
Kapabilitas dibatasi ketat pada tugas, bukan akses tetap "untuk jaga-jaga" Akses tetap yang luas mengubah kesalahan yang terbatas menjadi tidak terbatas Platform internal Lilli milik McKinsey dibobol oleh agent red-team melalui endpoint tanpa autentikasi yang seharusnya tidak pernah terjangkau
Input tidak tepercaya tidak pernah dieksekusi otomatis sebagai instruksi Undangan kalender, judul issue, dan email adalah teks yang dikendalikan penyerang, bukan perintah Insiden prompt-injection terdokumentasi terhadap pipeline CI coding agent dan browser agent dalam tinjauan CSA
Tombol henti/kill switch teruji yang benar-benar dipatuhi agent Agent yang terus berjalan setelah perintah henti tidak terbatas, apa pun maksud desainnya Studi multi-universitas 38 peneliti menemukan agent yang diterapkan terus bertindak setelah perintah henti eksplisit

Berapa Biaya Agent Ini: Per Tugas, Per Kredit, Per Seat

"Otonom" menyiratkan Anda membayar untuk hasil jadi, bukan seat langganan yang harus diingat seseorang untuk dipakai. Dalam praktiknya, tidak satu pun dari 9 produk dalam daftar ini menagih benar-benar per tugas selesai seperti platform enterprise berharga-hasil; Salesforce Agentforce menagih $2 per percakapan yang berhadapan dengan pelanggan, dan Sierra AI menagih harga kustom berbasis penyelesaian yang diperkirakan di atas $150.000 setahun, keduanya lebih dekat ke bayar-per-hasil sejati daripada apa pun di bawah. Yang akan Anda temui saat membeli agent otonom adalah salah satu dari tiga model biaya, dan mencampuradukkannya adalah cara tercepat untuk membengkakkan anggaran.

Meteran biaya AI agent otonom untuk unit komputasi, kredit, dan kolam langganan yang diterapkan pada tugas selesai yang sama

Agen Satuan Harga Yang Mengejutkan Pembeli
Devin Agent Compute Unit, kira-kira 15 menit kerja masing-masing Satu tugas sulit dapat menghabiskan kuota paket $20 dengan cepat
Manus Kredit yang diskalakan menurut kompleksitas tugas Riset mendalam atau build multi-langkah menguras kolam bulanan lebih cepat daripada run sederhana
ChatGPT agent Dibundel ke dalam tingkat langganan ChatGPT Anda membeli paket ChatGPT yang lebih luas, bukan produk agent bermeter
Claude Code Anggaran token bersama dengan penggunaan chat Claude biasa Sesi agent yang berat bersaing untuk kolam yang sama dengan chat sehari-hari
Genspark Kredit dibagi di chat, riset, dan run agent Chat "tak terbatas" punya batas sesi; kredit tidak terbawa dari bulan ke bulan
Skyvern Kredit per aksi browser (kira-kira 30 kredit/aksi) Workflow multi-langkah yang kompleks menghabiskan kredit lebih cepat daripada pengisian formulir sederhana
OpenHands Gratis self-hosted, atau inferensi model dengan harga asli pada tingkat cloud Fitur tata kelola enterprise (RBAC, SSO) hanya lewat penawaran, tidak termasuk dalam harga dasar
Lindy Kredit per tugas yang dikerjakan "karyawan" Tugas suara dan berat riset menghabiskan kolam jauh lebih cepat daripada triase sederhana
AutoGPT Langganan tetap plus kredit panggilan model pay-as-you-go Langganan tidak mencakup penggunaan model; itu ditagih terpisah di atasnya

Semua ini bukan alasan untuk menunggu kategori ini matang menjadi harga yang lebih rapi. Ini alasan untuk bertanya kepada setiap vendor, sebelum Anda menandatangani apa pun, berapa persisnya biaya salah satu tugas nyata dan representatif Anda dari ujung ke ujung, bukan yang tersirat dari harga masuk yang diiklankan.

1. Devin: Opsi Paling Otonom untuk Mengirimkan Kode

Devin adalah agent yang menjadikan "serahkan tiket dan tinggalkan" kategori produk nyata, bukan sekadar demo. Arsitektur Cognition mendukungnya dengan infrastruktur nyata: DeepWiki menjaga indeks permanen basis kode Anda, Devin Search membantunya bekerja di seluruh monorepo besar, dan agent kedua, Devin Review, mengkritik pull request sebelum manusia sempat melihatnya. Tetapkan tugas melalui Slack, Linear, atau aplikasi Devin sendiri, dan ia bekerja di VM sandbox-nya sendiri tanpa sesi terbuka di sisi Anda.

Coding agent ber-sandbox menyelesaikan tiket, mengindeks basis kode, dan meneruskan hasilnya melalui lensa tinjauan independen

Perlu diketahui sebelum membeli: video peluncuran Devin pada April 2024 kemudian ditunjukkan oleh peninjau independen, termasuk kanal YouTube Internet of Bugs dan Computer Vision Project, telah menghasilkan kode yang tidak berkaitan dengan tugas Upwork yang diklaim diselesaikannya. Produk Cognition telah matang secara substansial sejak itu, dan model SWE-1.7 miliknya kini melaporkan 81,5% pada Terminal-Bench 2.1 dan 77,8% pada SWE-bench Multilingual (laporan benchmark Cognition sendiri, 8 Juli 2026, jadi perlakukan sebagai batas atas yang dilaporkan vendor, bukan angka yang direproduksi secara independen). Riwayat itu layak diingat sebagai pengingat penentu kategori bahwa demo agent otonom yang paling nyaring dan produk agent otonom yang paling andal tidak selalu merupakan rilis yang sama.

Yang Anda dapatkan Yang tidak Anda dapatkan
VM sandbox sendiri per sesi tanpa editor atau terminal yang dibiarkan terbuka Kelebihan pemakaian berbasis ACU dapat mengubah paket $20 menjadi tagihan nyata yang jauh lebih besar
DeepWiki dan Devin Search untuk basis kode besar yang tidak dikenal Hasil terbaik mengasumsikan tiket yang cakupannya jelas, bukan permintaan yang samar
Devin Review menambahkan satu putaran agent kedua sebelum manusia melihat Skor benchmark independen non-vendor lebih sulit ditemukan daripada milik Cognition sendiri

Harga: Free adalah $0 dengan akses terbatas. Pro $20/bulan, Max $200/bulan, keduanya single-seat. Teams mulai $80/bulan plus $40/bulan per seat penuh, dengan kredit on-demand bersama. Enterprise kustom dan tetap ditagih dalam Agent Compute Unit. Sumber: pengumuman harga Cognition, 14 April 2026.

Terbaik untuk: Tim engineering yang ingin menyerahkan tiket yang cakupannya jelas sepenuhnya dan meninjau pull request jadi yang dikritik sendiri, alih-alih mengawasi sesi. Untuk perbandingan lengkap 14 coding agent, termasuk alternatif yang diawasi, lihat AI Coding Agent Terbaik di 2026.

2. Manus: Agent Serbaguna untuk Riset, Browsing, dan Output Terkirim

Manus adalah hal terdekat dengan generalis sejati dalam daftar ini: jelaskan hasil yang diinginkan dalam satu prompt (laporan riset kompetitif, prototipe yang berfungsi, spreadsheet terformat) dan ia merencanakan langkah, menjelajah web, menulis dan menjalankan kode, lalu menyerahkan artefak jadi, bukan transkrip chat. Keluarga model 1.6-nya (varian Lite, standar, dan Max), Scheduled Tasks 2.0, dan konektor Gmail, Calendar, dan Notion yang baru telah mendorongnya menjauh dari sekadar "agent riset" menuju asisten operasional umum sepanjang 2026.

Tingkat Pro mendukung hingga 20 tugas bersamaan dan 20 tugas terjadwal, pola pemakaian yang secara berarti berbeda dari satu sesi interaktif: Anda dapat mengantrekan beberapa pekerjaan tanpa pengawasan dan kembali ke hasil jadi alih-alih menjalankannya satu per satu.

Yang Anda dapatkan Yang tidak Anda dapatkan
Satu prompt merencanakan, browsing, membuat kode, dan mengirimkan artefak jadi Kredit cepat habis pada riset panjang atau tugas build multi-langkah
Hingga 20 tugas bersamaan dan 20 tugas terjadwal pada tingkat Pro Tingkat gratis dibatasi 1 tugas bersamaan, cukup untuk pengujian, bukan beban nyata
Konektor Gmail, Calendar, dan Notion untuk integrasi workflow nyata Kurang transparan soal biaya kredit per tugas yang pasti dibanding pesaing berbasis seat

Harga: Free $0 (300 kredit penyegaran harian, 1 tugas bersamaan). Tingkat berbayar mulai sekitar $20/bulan (kira-kira 4.000 kredit/bulan) dan naik hingga sekitar $40/bulan (kira-kira 8.000 kredit/bulan, 20 tugas bersamaan dan terjadwal, uji coba gratis 7 hari). Paket Team mulai dari $20 per seat/bulan. Semua tingkat berbayar mendapat diskon sekitar 17% jika ditagih tahunan. Sumber: help center Manus dan dokumentasi paket.

Terbaik untuk: Operator dan tim kecil yang ingin menjelaskan hasil yang diinginkan sekali dan mendapatkan deliverable jadi, bukan workflow yang harus mereka rakit sendiri.

3. ChatGPT agent: Penggunaan Browser dan Tool yang Dilebur ke dalam Langganan yang Kemungkinan Sudah Anda Bayar

ChatGPT agent adalah jawaban terpadu OpenAI atas pertanyaan yang sebelumnya dipecah lini produknya ke dalam dua tool. Operator, preview otomasi browser mandiri, diluncurkan pada Januari 2025 dan dihentikan pada 31 Agustus 2025, dengan kapabilitasnya diserap ke dalam ChatGPT agent bersama Deep Research. Hasilnya satu mode, dapat dipilih dari composer chat, yang dapat menjelajah, mengisi formulir, dan memakai tool sepanjang sesi, kini termasuk mulai paket Plus $20/bulan, bukan dikunci di balik peluncuran awal khusus Pro seharga $200/bulan.

Desain otonominya sengaja berbeda tingkat: ChatGPT agent akan meriset dan mengklik di berbagai situs tanpa berhenti bertanya, tetapi OpenAI menanamkan titik pemeriksaan tegas sebelum tindakan penting yang sulit dibatalkan seperti menyelesaikan pembelian atau mengirim pesan atas nama Anda. Itu perilaku tingkat 2 dan tingkat 3 dalam sesi yang sama, bukan satu tingkat otonomi yang tetap, dan merupakan bawaan yang masuk akal untuk produk dengan ratusan juta pengguna, bukan workflow bisnis yang sempit.

Yang Anda dapatkan Yang tidak Anda dapatkan
Mode agent dibundel dalam langganan yang sudah dimiliki sebagian besar pekerja pengetahuan Tidak ada mode cloud asinkron tinggalkan-saja sendiri; semuanya hidup dalam satu sesi
Langkah konfirmasi bawaan sebelum pembelian, pengiriman, atau tindakan lain yang sulit dibatalkan Merek dan benchmark "Operator" lama kini bersifat historis, bukan terkini
Menyerap Deep Research, sehingga riset multi-langkah dan browsing berbagi satu antarmuka Harga yang dilaporkan di atas Plus (Pro, Business, Enterprise) perlu pengecekan sales atau akun untuk dikonfirmasi

Harga: Free tidak mencakup mode agent. Plus $20/bulan dan membukanya. Pro (dilaporkan $200/bulan) membeli ruang penggunaan, bukan fitur baru. Harga Business dan Enterprise dinegosiasikan per akun. Sumber: paket ChatGPT dari OpenAI; verifikasi langsung saat penulisan menghasilkan error akses, jadi perlakukan angka Business/Enterprise sebagai dilaporkan sampai ada penawaran vendor terbaru.

Terbaik untuk: Tim yang sudah membayar ChatGPT Plus atau di atasnya dan menginginkan otonomi penggunaan browser dan tool tanpa menambah hubungan vendor baru.

4. Claude Code: Sesi Otonom yang Diperpanjang, Sesuai Desain Tidak Sepenuhnya Asinkron

Claude Code layak masuk daftar agent otonom karena alasan tertentu: ia menjalankan sesi panjang yang sebagian besar tanpa pengawasan di dalam terminal, menulis kode, menjalankan pengujian, memperbaiki yang rusak, dan melapor kembali, sering kali selama puluhan menit hingga berjam-jam tanpa ada orang yang mengawasi setiap suntingan. Yang sengaja tidak dilakukannya adalah membuka pull request secara asinkron seperti Devin atau Google Jules. Anthropic menanamkan Plan Mode dan permission prompt untuk file/perintah ke dalam produk dengan sengaja, yang menempatkan Claude Code satu tingkat di bawah "sepenuhnya tanpa pengawasan" karena pilihan desain, bukan kesenjangan kapabilitas.

Dengan menjalankan Opus 5 atau Sonnet 5, Claude Code berada di tingkat frontier pada SWE-bench Verified (96 hingga 97%, menurut leaderboard SWE-bench Verified, pertengahan Agustus 2026), meskipun seperti setiap harness berbasis model dalam daftar ini, batas atas itu mengikuti model yang mendasarinya, bukan skor yang diraih harness Claude Code secara independen.

Yang Anda dapatkan Yang tidak Anda dapatkan
Kesadaran git dan repo yang mendalam tanpa langkah pengindeksan Tidak ada mode cloud asinkron tinggalkan-saja bawaan
Plan mode dan permission prompt untuk kendali yang nyata dan dapat diaudit Penggunaan berbagi anggaran yang sama dengan penggunaan chat Claude biasa
Subagent untuk memparalelkan sub-tugas dalam satu sesi Memerlukan kenyamanan dengan workflow yang mengutamakan CLI

Harga: Free tidak mencakup Claude Code. Pro $17/bulan jika ditagih tahunan atau $20/bulan jika ditagih bulanan. Paket Max mulai $100/bulan (penggunaan 5x), dengan tingkat 20x yang lebih tinggi di atasnya. Team $20 hingga $25/seat/bulan tergantung penagihan, dengan opsi seat premium $100/seat/bulan. Enterprise kustom: biaya seat plus penggunaan. Sumber: claude.com/pricing.

Terbaik untuk: Tim engineering yang menginginkan sesi coding panjang yang sebagian besar tanpa pengawasan dengan jejak izin yang dapat diaudit, bukan agent cloud yang membuka PR saat tidak ada yang melihat. Lihat AI Coding Agent Terbaik di 2026 untuk perbandingan mendalam dengan Devin, Copilot, dan 11 coding agent lainnya.

5. Genspark: Super Agent Terpadu dalam Workspace AI Serba Ada

Tawaran Genspark adalah keluasan: satu langganan menggabungkan chat AI, riset, pembuatan gambar dan video, pembuatan presentasi, dan mode "agent" otonom yang dapat merencanakan dan mengeksekusi tugas multi-langkah, alih-alih menjual agent sebagai produk mandiri seperti yang dilakukan Manus. Bagi tim yang menginginkan satu pos anggaran AI alih-alih lima tool terpisah, konsolidasi itulah seluruh daya tariknya.

Konsekuensinya adalah kedalaman. Run agent Genspark kurang terspesialisasi dibanding agent riset atau browsing yang dibuat khusus, dan karena kredit dibagi di chat, riset, dan tugas agent dalam satu kolam, penggunaan agent yang berat dapat menyingkirkan fungsi lain dari langganan itu.

Yang Anda dapatkan Yang tidak Anda dapatkan
Chat, riset, pembuatan gambar/video, dan run agent dalam satu langganan Kapabilitas agent lebih luas tetapi lebih dangkal daripada spesialis berfungsi tunggal
Tingkat gratis yang benar-benar dapat dipakai (100 kredit/hari) tanpa kartu kredit Kredit dibagi di setiap fitur, tidak dicadangkan khusus untuk penggunaan agent
Paket tim tersedia untuk organisasi yang menstandarkan satu vendor AI Chat "tak terbatas" memiliki batas sesi, dan keuntungan chat AI tanpa kredit adalah syarat promosi, bukan permanen

Harga: Free $0 (100 kredit/hari, sekitar 1GB penyimpanan). Plus dilaporkan $24,99/bulan ($19,99/bulan jika ditagih tahunan, kira-kira 10.000 kredit/bulan). Pro dilaporkan $249,99/bulan ($199,99/bulan tahunan, kira-kira 125.000 kredit/bulan). Team menambah seat seharga $30/bulan per seat. Verifikasi langsung atas halaman harga Genspark sendiri diblokir saat penulisan; angka-angka ini diperiksa silang di beberapa pelacak independen 2026 dan harus dikonfirmasi ulang pada genspark.ai/pricing sebelum pembelian.

Terbaik untuk: Tim yang menginginkan kapabilitas agent dibundel dengan chat AI dan tool konten sehari-hari dalam satu langganan, alih-alih membeli produk agent khusus secara terpisah.

6. Skyvern: Workflow Browser Sepenuhnya Tanpa Pengawasan Setelah Anda Mengonfigurasinya

Skyvern memakai pendekatan otomasi browser yang berbeda dari agent yang mengutamakan chat: ia memadukan computer vision dengan LLM untuk mengenali dan berinteraksi dengan elemen halaman seperti yang dilakukan manusia, sehingga dapat beroperasi di situs tanpa API yang dapat dipakai (portal pemerintah lama, sistem pengadaan vendor yang lebih tua, alur checkout ritel) tanpa skrip berbasis selector yang rapuh. Begitu workflow dibangun, ia benar-benar otonom tingkat 4: berjalan berdasarkan jadwal atau trigger API tanpa tinjauan per run, hanya melakukan eskalasi ketika menemui CAPTCHA, prompt dua faktor, atau tata letak halaman yang tidak dikenalinya.

Langkah konfigurasi itu adalah kendala yang jujur. Skyvern bukan generalis satu-prompt seperti Manus; ia lebih dekat ke RPA dengan model visi alih-alih selector rapuh, artinya investasi penyiapan itu nyata meskipun hasilnya, setelah berjalan, adalah entri paling bebas tangan dalam daftar ini.

Yang Anda dapatkan Yang tidak Anda dapatkan
Otomasi berbasis visi untuk situs tanpa API bersih yang dapat dipanggil Memerlukan konfigurasi workflow nyata sebelum run benar-benar tanpa pengawasan
Eskalasi berbasis pengecualian (CAPTCHA, 2FA, UI tidak dikenal) alih-alih tinjauan per run Kredit diukur per aksi, sehingga alur multi-langkah yang kompleks lebih mahal daripada yang sederhana
Tingkat gratis yang dapat dipakai untuk pengujian sebelum berkomitmen pada paket berbayar Harga Enterprise dan SLA memerlukan percakapan dengan sales

Harga: Free $0 (5.000 kredit, kira-kira 170 aksi). Hobby $29/bulan (30.000 kredit, kira-kira 1.200 aksi). Pro $149/bulan (150.000 kredit, kira-kira 6.200 aksi). Enterprise kustom. Sumber: skyvern.com/pricing.

Terbaik untuk: Tim ops dan RevOps yang mengotomatiskan tugas browser yang terdefinisi dan berulang (entri data, pengiriman formulir, pengadaan) yang sebaliknya memerlukan integrasi API khusus yang tidak ada.

7. OpenHands: Agent Open-Source yang Dapat Anda Miliki Sepenuhnya

OpenHands (sebelumnya OpenDevin) adalah opsi untuk tim yang menginginkan nol kotak hitam dalam jalur eksekusi agent otonom mereka. Setiap aksi, menjalankan perintah shell, menyunting file, menjelajah halaman, terjadi di dalam sandbox Docker sekali pakai, sehingga tidak ada yang menyentuh mesin host, dan karena sepenuhnya open source di bawah MIT, Anda dapat membaca, mengaudit, atau memodifikasi persis apa yang diizinkan untuk dilakukannya alih-alih memercayai deskripsi guardrail dari vendor.

Host sendiri secara gratis, atau gunakan tingkat cloud Individual yang di-host, juga gratis, dibatasi 10 percakapan per hari, dengan membawa API key model Anda sendiri. Batas itu adalah langit-langit praktis untuk seberapa jauh Anda dapat menjalankannya tanpa pengawasan tanpa melakukan self-hosting atau pindah ke paket Enterprise berharga kustom dengan RBAC dan SSO. Karena OpenHands banyak dipakai untuk tugas coding, perbandingan benchmark lengkapnya dengan Devin, Claude Code, dan 11 agent khusus coding lainnya ada di panduan coding agent kami; di sini, fakta yang lebih relevan bersifat arsitektural: self-hosting memindahkan seluruh beban guardrail ke keputusan infrastruktur Anda sendiri, baik atau buruknya.

Yang Anda dapatkan Yang tidak Anda dapatkan
Sepenuhnya open source (MIT) dan dapat di-host sendiri, atau tingkat cloud hosting gratis Tingkat cloud gratis dibatasi 10 percakapan per hari
Eksekusi Docker ber-sandbox secara bawaan; tidak ada yang menyentuh host Harga Enterprise (RBAC, SSO) sepenuhnya berbasis penawaran
Visibilitas penuh atas apa persisnya yang diizinkan dilakukan agent Ekosistem dukungan komersial lebih kecil daripada pesaing yang didukung modal ventura

Harga: Open source self-hosted gratis di bawah lisensi MIT. Tingkat cloud Individual gratis (batas 10 percakapan/hari), bawa API key sendiri atau bayar model OpenHands dengan harga asli. Enterprise (SaaS atau self-hosted di VPC Anda) kustom. Sumber: openhands.dev/pricing.

Terbaik untuk: Tim dan peneliti yang menginginkan agent otonom yang dapat diaudit sepenuhnya dan di-host sendiri, di mana guardrail-nya dapat Anda periksa, bukan sekadar mengandalkan ucapan vendor.

8. Lindy: Yang Dibangun untuk Berjalan Terus-Menerus, Bukan Sekali Saja

Setiap produk lain dalam daftar ini menjalankan tugas terbatas: Anda memberinya tujuan, ia bekerja, lalu berhenti. Lindy secara struktural berbeda. Konfigurasikan "karyawan" Lindy (manajemen inbox, penyaringan panggilan, penjadwalan rapat) sekali, dan ia berjalan terus-menerus berdasarkan trigger, email baru, panggilan masuk, alih-alih memulai dari awal dengan prompt setiap kali. Itu pola otonomi yang benar-benar berbeda dan layak dipisahkan dari daftar lainnya: bukan "berapa lama satu run berlangsung", melainkan "sudah berapa lama ini berjalan tanpa ada yang menyentuhnya".

Lindy mendukung langkah persetujuan manusia yang opsional pada tindakan individual, sehingga pembeli dapat mengatur sebuah karyawan di mana saja dari sepenuhnya tanpa pengawasan hingga bertindak-dengan-persetujuan tergantung risiko pekerjaan tertentu. Konfigurabilitas itu, lebih daripada kapabilitas mentah, adalah alasan ia muncul baik di daftar ini maupun di panduan no-code agent builder: produk yang sama melayani pengguna bisnis yang merakit workflow dan pembeli yang secara khusus mencari sesuatu yang berjalan tanpa pengawasan tanpa batas waktu.

Yang Anda dapatkan Yang tidak Anda dapatkan
Berjalan terus-menerus berdasarkan trigger, bukan satu siklus prompt-ke-output terbatas Kredit gabungan cepat habis pada tugas suara atau berat riset
Langkah persetujuan per tindakan yang opsional untuk menaikkan atau menurunkan otonomi per pekerjaan Harga kredit per pengguna menjadi mahal di tim besar
Tingkat Enterprise yang memenuhi syarat HIPAA dengan BAA yang ditandatangani Kurang cocok untuk logika bercabang yang kompleks dibanding framework code-first

Harga: Plus $29,99/bulan per pengguna (3.000 kredit). Pro $99,99/bulan (15.000 kredit). Max $199,99/bulan (35.000 kredit). Enterprise kustom, menambah HIPAA BAA, SSO, dan audit log. Jika kolam kredit menipis, Lindy menjeda karyawan dan memberi tahu Anda alih-alih menagih kelebihan secara otomatis. Sumber: lindy.ai/pricing.

Terbaik untuk: Founder dan tim ops yang mendelegasikan seluruh fungsi pekerjaan yang berkelanjutan, bukan satu tugas dengan garis akhir yang jelas.

9. AutoGPT: Sang Pelopor, Dibangun Ulang sebagai Platform, Masih Merebut Kembali Kepercayaan

AutoGPT adalah nama yang menjadikan "AI agent otonom" frasa yang dikenal orang awam, pada 2023, ketika loop terbuka aslinya (beri tujuan apa pun, biarkan bernalar sendiri tanpa perancah) viral lalu menabrak batas keras dari apa yang dapat dihasilkan otonomi tanpa perancah secara andal: agent yang berputar-putar, melenceng dari tugas, atau sekadar tidak pernah selesai.

Loop AutoGPT terbuka yang asli dibandingkan dengan platform workflow visual berperancah saat ini

Versi 2026 adalah kemunduran yang disengaja dari premis itu, dan layak dibaca sebagai bukti, bukan sebagai penurunan. AutoGPT Platform kini merupakan block builder visual low-code dengan marketplace agent siap pakai, penjadwalan workflow, dan kontrol deployment, jenis perancah yang secara eksplisit tidak dimiliki loop aslinya. Anda dapat melakukan self-hosting seluruhnya secara gratis, atau membayar versi hosting. Fakta bahwa produk perintis yang menentukan kategori ini memerlukan struktur dan blok yang ditentukan manusia agar benar-benar dapat dipakai adalah data berguna tentang seberapa jauh klaim "sepenuhnya otonom, tujuan apa pun" masih harus ditempuh.

Yang Anda dapatkan Yang tidak Anda dapatkan
Nama merek paling dikenal dalam agent otonom, dibangun ulang demi keandalan Jauh dari premis asli "tujuan apa pun, tanpa perancah" yang membuatnya terkenal
Self-hosting gratis tanpa batas bagi tim yang menginginkan kendali penuh Pengali penggunaan versi cloud membuat biaya lebih sulit diprediksi daripada biaya tetap
Block builder visual dan marketplace agent menurunkan ambang membangun sendiri Langganan tidak mencakup penggunaan model; kredit pay-as-you-go ditagih terpisah

Harga: Self-hosted gratis (open source). Cloud Pro $42,50/bulan jika ditagih tahunan. Cloud Max $272/bulan jika ditagih tahunan (pengali penggunaan 8,5x). Tingkat Team belum tersedia secara umum. Semua tingkat cloud menarik kredit pay-as-you-go di atas langganan, berdasarkan panggilan model dan komputasi yang sebenarnya. Sumber: agpt.co.

Terbaik untuk: Tim yang menginginkan cara low-code untuk membangun dan menjadwalkan agent otonom mereka sendiri tanpa memulai dari framework kosong, dan yang memahami bahwa "AutoGPT" hari ini berarti sebuah builder, bukan satu agent otonom serbaguna.

Cara Memilih: Kerangka Pengambilan Keputusan

Mulailah dari hasil yang ingin Anda serahkan kepemilikannya kepada agent, lalu pilih produk yang batas eksekusi dan model tinjauannya sesuai dengan pekerjaan itu.

Pemilih keputusan AI agent otonom yang mencocokkan pengiriman terbatas, workflow browser, trigger berkelanjutan, kepemilikan terbuka, dan pekerjaan coding

Jika Anda membutuhkan... Pilih... Mengapa
Pull request jadi tanpa sesi terbuka di sisi Anda Devin VM sandbox sendiri, pengindeksan DeepWiki, dan putaran tinjauan sendiri sebelum Anda melihat
Satu prompt untuk meriset, membangun, dan mengirimkan artefak jadi Manus Merencanakan, browsing, membuat kode, dan menyerahkan dokumen atau build, bukan log chat
Kapabilitas agent dalam langganan yang sudah Anda bayar ChatGPT agent Dibundel ke dalam ChatGPT Plus; konfirmasi bawaan sebelum tindakan yang sulit dibatalkan
Sesi coding panjang yang sebagian besar tanpa pengawasan dengan jejak audit Claude Code Permission prompt dan Plan Mode menjaga setiap penulisan dapat ditinjau, sesuai desain
Run agent yang dibundel dengan chat AI dan tool konten sehari-hari Genspark Satu langganan alih-alih vendor khusus agent
Workflow browser terdefinisi yang harus berjalan tanpa tinjauan setelah penyiapan Skyvern Otomasi berbasis visi yang hanya melakukan eskalasi pada CAPTCHA dan status UI tidak dikenal
Visibilitas penuh atas apa yang dapat dilakukan agent OpenHands Open source, dapat di-host sendiri, ber-sandbox secara bawaan
Fungsi pekerjaan yang berjalan terus-menerus, bukan satu tugas terbatas Lindy Trigger, bukan prompt; naikkan atau turunkan otonomi per tindakan
Membangun dan menjadwalkan agent sendiri tanpa framework kode AutoGPT Builder visual low-code, dibangun ulang demi keandalan setelah loop asli 2023

Langkah Selanjutnya

Pilih satu tugas nyata yang terbatas, bukan skenario demo, dan jalankan melalui tingkat gratis atau tingkat awal pilihan teratas Anda sebelum berkomitmen pada apa pun yang tahunan. Perhatikan secara khusus di mana agent berhenti dan bertanya versus di mana ia terus berjalan, karena perilaku itulah yang menentukan risiko Anda yang sebenarnya, bukan tingkat otonomi di halaman harga. Jika pekerjaan menyentuh data produksi, transaksi keuangan, atau hal lain yang tidak dapat Anda batalkan dengan bersih, mulailah di salinan ber-sandbox terlepas dari apa pun yang dijanjikan pemasaran vendor tentang keamanan. Dan sebelum salah satu dari 9 tool ini mendapat akses tetap ke sistem nyata, jalankan daftar periksa guardrail di atas bersama pemilik risiko di tim Anda; ROI AI agent adalah bacaan lanjutan yang berguna untuk menaksir nilai peluncuran yang berhasil dibandingkan dengan risiko itu. Untuk lanskap platform dan framework agent yang lebih luas yang Anda pakai untuk membangun sesuatu yang kustom alih-alih membeli salah satu dari 9 ini, Platform AI Agent Terbaik di 2026 adalah panduan utama untuk sisa kategori ini.

About the author

Camellia

Camellia

Principal Product Marketing Strategist

Camellia is Principal Product Marketing Strategist at Rework, helping B2B buyers pick the right software with confidence. With 6+ years in product marketing and 150+ SaaS tools evaluated across CRM, project management, and sales engagement, Camellia turns competitive intelligence into clear, honest comparisons. Readers get vendor evaluations they can trust to cut through marketing noise and decide faster.