Grok 4.5 agent testda birinchilikni qo‘lga kiritib, Ilon Maskning Opus darajasidagi sunʼiy intellekt haqidagi daʼvosini tasdiqladi

  • Grok 4.5 mustaqil agentlar reytingida birinchi o‘rinni egalladi, Ilon Maskning xarajatlar haqidagi da’volarini tasdiqladi
  • Model AutomationBench-AA testidan 51,4% natija oldi va yetakchilar orasida eng arzon narxga ega bo‘ldi.
  • Biroq, ushbu model har bir vazifa uchun o‘rtacha 0.63 ta qoidabuzarlikni qayd etdi, bu raqobatchilarga qaraganda ko‘proq.

Ilon Mask Grok 4.5 ni Opus-toifasidagi model deb atadi, u tezroq ishlaydi va arzon turadi. Endi mustaqil, agentik baholash mavjud bo‘lib, bu da’volarga asosli dalil beradi.

«Artificial Analysis» (tahlil tashkiloti) tomonidan tayyorlangan AutomationBench-AA reytingida, Grok 4.5 51,4% natija bilan birinchi o‘rinni egalladi va har bir vazifa uchun atigi $0,34 sarfladi. U «Claude Fable 5» (48,6%) va «Claude Opus 4.8» (48,5%) modellaridan ustun chiqdi.

AI modellari uchun AutomationBench-AA natijalari.
AI modellari uchun AutomationBench-AA natijalari. Manba: «Artificial Analysis»

Ilon Mask da’vosining mustaqil tekshiruvi

Hafta davomida «SpaceXAI» (sun’iy intellekt tashkiloti) Grok 4.5 ni ochiq tarzda taqdim etdi. Bu model 1,5 trillion parametrdan iborat V9 asosida yaratilgan. Ilon Maskning taqdimoti dastlab ichki tekshiruvlarga asoslangan edi.

AutomationBench-AA esa vaziyatni o‘zgartirdi. «Artificial Analysis» ushbu mezonni mustaqil tarzda ishga tushirib, vazifa to‘plamini yopiq holda saqlaydi. Bu modelga chetdan ta’sir yetkazilmaydi.

Sinov 657 ta vazifani o‘z ichiga oladi. U 40 ta simulyatsiya qilingan dastur, jumladan Gmail, Slack, Salesforce va HubSpot bo‘ylab o‘tkaziladi. Natijalarda agent himoya qoidalarini buzmasdan, qanchalik samarali maqsadlarga erishgani baholanadi.

Yangiliklardan xabardor bo‘lish uchun bizni «X» ijtimoiy tarmog‘ida kuzatib boring

Grok 4.5: Arzon, tez va aksariyat qoidalarga mos

Grok 4.5 har bir vazifaga $0,34 sarfladi. Bu «Fable 5» uchun $1,35 va Opus 4.8 uchun $1,46 bilan solishtirganda ancha pastdir. «Gemini 3.5 Flash» esa $0,49 bilan eng yaqin natijani ko‘rsatdi.

Model har bir vazifada taxminan 8 000 ta chiqish tokenidan foydalandi, bu esa Opus 4.8 natijasining atigi chorak qismidir. Bu samaradorlik asosiy xarajatlar farqini yuzaga keltirdi va bu Ilon Mask taqdimotida ham alohida ta’kidlangan.

“Ushbu modelning har bir vazifa uchun umumiy token ishlatishi 0.44 million bo‘lib, reytingdagi eng kam natijalardan biriga ega. Arzonlik aynan mana shu samaradorlik va arzon token narxi hisobiga ta’minlanadi,” — dedi «Artificial Analysis» ijtimoiy tarmog‘i «X» dagi sahifasida.

Bundan tashqari, Grok 4.5 vazifalarning 79,9%da ko‘zlangan maqsadga erisha oldi va 21,9% vazifani to‘liq bajarib berdi. Eng murakkab soha — Moliya yo‘nalishida esa Grok 4.5, 71% natija bilan boshqalardan oldinda bordi. «Fable 5» ko‘rsatkichi 64%, «Opus 4.8» natijasi esa 62% bo‘ldi.

Biroq, model eng yaqin raqobatchilariga qaraganda ko‘proq qoidabuzarlikka yo‘l qo‘ydi. Har bir vazifa uchun 0,63 ta qoidani buzgan, bu esa «Opus 4.8»da 0,55, «Gemini 3.5 Flash»da 0,46 ni tashkil etdi.

Bu farq juda muhim. Ayniqsa, agentlardan foydalaniladigan jonli moliyaviy tizimlarda, bitta xato ham haqiqiy zarar olib kelishi mumkin.

Yangi videolar va tahlillar uchun Youtube kanalimizga obuna bo‘ling


BeInCrypto’dan kriptovalyuta bozorining so‘nggi tahlilini o‘qish uchun, bu yerni bosing.

Diskleymer

BeInCrypto faqat xolis va haqqoniy ma’lumotlarni taqdim etishga intiladi. Ushbu yangilik maqolasining maqsadi voqeani aniq va o‘z vaqtida yoritishdir. Shunga qaramay, BeInCrypto o‘quvchilarga ushbu kontent asosida moliyaviy qaror qabul qilishdan oldin ma’lumotni mustaqil ravishda tekshirishni va mutaxassis bilan maslahatlashishni tavsiya qiladi. Shuningdek, Shartlar va qoidalar, Maxfiylik siyosati va Diskleymerlar yangilandi.