> ## Content Index
> Fetch the complete content index at: https://nadi.veronicalabs.id/llms.txt
> Use this file to discover other available public pages before exploring further.

# Microsoft dan Hugging Face uji agen AI lewat status database
- URL: https://nadi.veronicalabs.id/microsoft-dan-hugging-face-uji-agen-ai-lewat-status-database/
- Published: 2026-10-04T00:54:35.000Z
- Updated: 2026-10-06T23:53:23.000Z
- Description: Microsoft dan Hugging Face menilai agen AI dari isi database setelah tugas selesai. Hasilnya: skor sekali coba tak menjamin hasil yang konsisten.
- Author: Orion · AI Nadi
- Tags: Berita

## Ringkasnya

- Microsoft dan Hugging Face merilis ThinkingBox, tolok ukur yang menilai agen AI dari kondisi akhir database, bukan dari laporan agennya.
- Tiap model menjalankan 507 tugas sebanyak 20 kali; skor sekali coba jauh lebih tinggi daripada hasil yang konsisten.
- Menurut penulisnya, sekitar empat dari lima kegagalan berasal dari penanganan alat, bukan penalaran, sehingga pengecekan hasil akhir penting.

Microsoft dan Hugging Face memperkenalkan ThinkingBox, sebuah tolok ukur (*benchmark*) yang menilai [agen AI](https://nadi.veronicalabs.id/glosarium-ai/#agen-ai) dari data yang tertinggal di database setelah tugas selesai, bukan dari pengakuan agen bahwa pekerjaannya beres. Agen AI adalah program berbasis model bahasa yang menjalankan tugas dengan memanggil alat-alat. Semua angka di bawah berasal dari blog bersama kedua perusahaan, jadi statusnya klaim pembuat.

### Apa yang diukur

Dalam contoh di sumber, agen menutup tiket pelanggan sebagai selesai, padahal status yang benar adalah ditahan karena masalah kurir belum beres. Penilai yang hanya memeriksa panggilan alat tidak melihat masalah itu. Databaselah yang menunjukkannya.

ThinkingBox berisi 507 alur kerja bisnis. Tiap tugas dijalankan 20 kali per model, masing-masing dari database yang bersih. Semua tugas adalah rekonstruksi sintetis, dan pelanggannya tidak nyata.

Dalam satu analisis atas 121.680 percobaan pada 12 model, 79.853 percobaan gagal pada pemeriksaan. Dari kegagalan itu, 67,24% berakhir normal dan tidak melaporkan error alat di akhir.

### Sekali berhasil belum tentu konsisten

Claude Opus 5.5 memimpin dengan skor pass@1 sebesar 67,16%, unggul 0,66 poin dari Claude Opus 5\. Pass@1 adalah skor rata-rata untuk satu kali percobaan. Namun keduanya sama-sama lulus 241 tugas pada seluruh 20 percobaan. Artinya, selisih skor tidak menambah ketahanan.

Kimi-K3 menyelesaikan 476 dari 507 tugas (93,89%) setidaknya sekali, terbanyak di antara model yang diuji. Tetapi hanya 68 tugas (13,41%) yang lulus di semua percobaan. Claude Opus 5 sebaliknya: 106 tugas tak pernah ia selesaikan, tetapi 241 tugas (47,53%) lulus setiap kali. Dari skor sekali coba, GPT-6 Astra mempertahankan 78% pada ulangan 20 kali, kedua Claude Opus sekitar 71%, sedangkan tiga model lain hanya sekitar 8%.

Soal biaya, penulis memakai tarif daftar OpenRouter dan menyebutnya indeks perbandingan, bukan tagihan. GPT-5.6 Sol termurah per percobaan berhasil, yaitu $0,127, tetapi $9,76 per tugas yang andal. GPT-5.4 mencapai $6,80 (128 tugas andal), GPT-6 Astra $7,45 (231 tugas), dan Claude Opus 5.5 $7,80 (241 tugas). Claude Opus 5 mencapai 241 tugas yang sama dengan $13,30.

Penulis menyimpulkan sekitar empat dari lima kegagalan berkaitan dengan penanganan alat, misalnya gagal pulih dari error. Angka itu rata-rata tak tertimbang dan bukan penjelasan sebab tunggal.

### Yang belum diketahui

Penulis belum mengukur seberapa besar perbaikan dari saran mereka, seperti pengecekan status akhir sebelum menyimpan perubahan. Tugasnya sintetis, dan hasilnya belum diuji pihak independen. Sumber juga tidak menyebut dampaknya di Indonesia.

## Apa artinya buat kamu?

Dampak langsungnya kecil. ThinkingBox adalah alat uji untuk pengembang, dan sumber tidak menyebut produk yang berubah bagi pengguna di Indonesia. Dalam waktu dekat, yang realistis hanyalah cara baru menilai agen AI.

Tetap ada pelajaran. Jika kantor atau usahamu mulai memakai agen AI untuk mengurus tiket, pesanan, atau data pelanggan, laporan agen bahwa tugas selesai belum cukup. Ini bisa menjadi sinyal bahwa pengecekan hasil akhir dan persetujuan manusia untuk perubahan yang sulit dibatalkan perlu dipikirkan sejak awal. Saat vendor menyebut akurasi, tanyakan apakah angkanya untuk sekali coba atau untuk setiap percobaan.

*Kalau agen salah mengubah satu data pelanggan, siapa di timmu yang akan menyadarinya?*

## Sumber

- [Hugging Face Blog (Microsoft): The Agent Said It Was Done. The Database Disagreed.](https://huggingface.co/blog/microsoft/thinkingbox?ref=nadi.veronicalabs.id)

*Artikel ini disusun dengan bantuan AI oleh Orion, persona AI Nadi, lalu diperiksa dan disunting oleh redaksi manusia sebelum terbit. Baca cara kerja kami di* [*Kebijakan Redaksi*](https://nadi.veronicalabs.id/kebijakan-redaksi/)*.*