ServiceNow Buat Data Latihan Otomatis untuk Agen AI Perusahaan
ServiceNow CoreAI melaporkan AutoSynthData, sistem pembuat data latihan agen AI. Pada uji internal, skor model naik 7,2 poin persentase.
Ringkasnya
- Tim ServiceNow CoreAI memaparkan AutoSynthData, sistem yang membuat dan menyaring data latihan otomatis berdasarkan kelemahan sebuah model AI.
- Dalam uji internal, Pass@1 rata-rata model Gemma naik 7,2 poin persentase pada domain Hybrid, dan dari 18,77% ke 27,18% pada ITSM.
- Angka ini klaim perusahaan di lingkungan terkontrol dan belum diuji pihak independen, tetapi menunjukkan arah pelatihan agen yang makin terarah.
Tim ServiceNow CoreAI memaparkan AutoSynthData, sistem yang membuat data latihan secara otomatis untuk agen AI di lingkungan perusahaan. Penjelasannya terbit di blog Hugging Face, dan tanggal terbitnya tidak tercantum di halaman sumber. Dalam uji internal mereka, model yang dilatih dengan data ini mendapat skor lebih tinggi pada sebuah tolok ukur.
Masalah yang ingin dijawab
Agen AI adalah program berbasis model bahasa yang tidak hanya menjawab, tetapi juga menjalankan tugas lewat berbagai alat dan sistem. Menurut ServiceNow, model yang pintar secara umum tetap bisa tersandung di lingkungan kerja tertentu, misalnya pada alur kerja tertentu atau aturan perusahaan yang harus dipatuhi. Untuk memperbaikinya dibutuhkan banyak soal latihan baru yang bisa dikerjakan, mirip permintaan nyata, dan punya cara andal untuk memeriksa hasilnya.
Cara kerjanya
Pertama, sistem menguji model yang mau dilatih (model target) dan model lain yang lebih kuat (guru). Dari situ terlihat di mana model target gagal dan bagaimana guru berhasil. Temuan itu diringkas menjadi kartu spesifikasi kemampuan, lalu sebuah generator membuat tugas baru tanpa melihat soal evaluasi aslinya.
Setiap tugas baru disaring. Tugas diutamakan jika model target hanya menyelesaikannya paling banyak satu dari tiga percobaan, sedangkan model guru menyelesaikannya minimal dua dari tiga. Jawaban acuan dijalankan untuk memastikan benar, dan hasil yang sengaja diubah harus gagal pemeriksaan. Tugas yang gagal diperbaiki dalam batas percobaan tertentu. Tugas yang lolos dipakai untuk supervised fine-tuning (SFT), yaitu melatih model dengan contoh pengerjaan yang benar.
Hasil yang dilaporkan
Tolok ukurnya bernama EnterpriseOps Gym, yang mengukur apakah agen bisa menyelesaikan tugas di lingkungan perusahaan simulasi. Pass@1 adalah persentase tugas yang selesai pada percobaan pertama. Pada domain Hybrid, 2.000 sampel latihan dibuat dalam sekitar 18 jam. Pass@1 rata-rata model Gemma-4-26B-A4B-it naik 7,2 poin persentase, atau 35% secara relatif. Keberhasilan menurut verifier naik dari 63,01% menjadi 68,55%. ServiceNow menyebut hasil ini menutup 59% selisih antara Gemma dan model acuan.
Pada domain ITSM, 1.994 sampel dibuat dalam 66 jam, dengan model guru berbeda dan sebelum optimasi kecepatan. Pass@1 naik dari 18,77% menjadi 27,18%, sekitar 8,4 poin persentase.
Yang belum kita ketahui
Semua angka berasal dari tim ServiceNow sendiri dan belum ada pengujian independen. Skor checkpoint terbaik (epoch 5) dilaporkan pada tolok ukur yang sama dengan evaluasi, dan sumber tidak menjelaskan cara checkpoint itu dipilih. Sumber juga tidak menyebut biaya, maupun rencana menjadikan sistem ini produk. Penulisnya sendiri menyebut hasil ini berlaku di lingkungan terkontrol, dan pengujian dengan reinforcement learning baru direncanakan.
Apa artinya buat kamu?
Dampak langsungnya ke kamu kecil. Ini laporan teknis tentang cara melatih agen AI di perusahaan, bukan produk yang bisa kamu pakai hari ini, dan sumber tidak menyebut kaitannya dengan Indonesia.
Namun ini bisa menjadi sinyal arah: pelatihan AI mulai berfokus pada kegagalan model di lingkungan kerja tertentu, bukan hanya membuat model makin besar. Kalau agen AI nanti masuk ke kantor atau usahamu, hasilnya bergantung pada seberapa baik ia dilatih di sistem yang kamu pakai.
Kamu bisa memantau satu hal: apakah klaim peningkatan seperti ini nanti dikonfirmasi pihak independen.
Kalau sebuah agen AI bekerja di sistemmu, bagaimana kamu akan menilai bahwa ia benar-benar berhasil?
Sumber
- Hugging Face Blog (ServiceNow CoreAI): AutoSynthData: Generating Training Data for Enterprise Agents
Artikel ini disusun dengan bantuan AI oleh Orion, persona AI Nadi, lalu diperiksa dan disunting oleh redaksi manusia sebelum terbit. Baca cara kerja kami di Kebijakan Redaksi.