Ilon Mask Grok 4.5 ni Opus-toifasidagi model deb atadi, u tezroq ishlaydi va arzon turadi. Endi mustaqil, agentik baholash mavjud bo‘lib, bu da’volarga asosli dalil beradi.
«Artificial Analysis» (tahlil tashkiloti) tomonidan tayyorlangan AutomationBench-AA reytingida, Grok 4.5 51,4% natija bilan birinchi o‘rinni egalladi va har bir vazifa uchun atigi $0,34 sarfladi. U «Claude Fable 5» (48,6%) va «Claude Opus 4.8» (48,5%) modellaridan ustun chiqdi.
Ilon Mask da’vosining mustaqil tekshiruvi
Hafta davomida «SpaceXAI» (sun’iy intellekt tashkiloti) Grok 4.5 ni ochiq tarzda taqdim etdi. Bu model 1,5 trillion parametrdan iborat V9 asosida yaratilgan. Ilon Maskning taqdimoti dastlab ichki tekshiruvlarga asoslangan edi.
AutomationBench-AA esa vaziyatni o‘zgartirdi. «Artificial Analysis» ushbu mezonni mustaqil tarzda ishga tushirib, vazifa to‘plamini yopiq holda saqlaydi. Bu modelga chetdan ta’sir yetkazilmaydi.
Sinov 657 ta vazifani o‘z ichiga oladi. U 40 ta simulyatsiya qilingan dastur, jumladan Gmail, Slack, Salesforce va HubSpot bo‘ylab o‘tkaziladi. Natijalarda agent himoya qoidalarini buzmasdan, qanchalik samarali maqsadlarga erishgani baholanadi.
Yangiliklardan xabardor bo‘lish uchun bizni «X» ijtimoiy tarmog‘ida kuzatib boring
Grok 4.5: Arzon, tez va aksariyat qoidalarga mos
Grok 4.5 har bir vazifaga $0,34 sarfladi. Bu «Fable 5» uchun $1,35 va Opus 4.8 uchun $1,46 bilan solishtirganda ancha pastdir. «Gemini 3.5 Flash» esa $0,49 bilan eng yaqin natijani ko‘rsatdi.
Model har bir vazifada taxminan 8 000 ta chiqish tokenidan foydalandi, bu esa Opus 4.8 natijasining atigi chorak qismidir. Bu samaradorlik asosiy xarajatlar farqini yuzaga keltirdi va bu Ilon Mask taqdimotida ham alohida ta’kidlangan.
“Ushbu modelning har bir vazifa uchun umumiy token ishlatishi 0.44 million bo‘lib, reytingdagi eng kam natijalardan biriga ega. Arzonlik aynan mana shu samaradorlik va arzon token narxi hisobiga ta’minlanadi,” — dedi «Artificial Analysis» ijtimoiy tarmog‘i «X» dagi sahifasida.
Bundan tashqari, Grok 4.5 vazifalarning 79,9%da ko‘zlangan maqsadga erisha oldi va 21,9% vazifani to‘liq bajarib berdi. Eng murakkab soha — Moliya yo‘nalishida esa Grok 4.5, 71% natija bilan boshqalardan oldinda bordi. «Fable 5» ko‘rsatkichi 64%, «Opus 4.8» natijasi esa 62% bo‘ldi.
Biroq, model eng yaqin raqobatchilariga qaraganda ko‘proq qoidabuzarlikka yo‘l qo‘ydi. Har bir vazifa uchun 0,63 ta qoidani buzgan, bu esa «Opus 4.8»da 0,55, «Gemini 3.5 Flash»da 0,46 ni tashkil etdi.
Bu farq juda muhim. Ayniqsa, agentlardan foydalaniladigan jonli moliyaviy tizimlarda, bitta xato ham haqiqiy zarar olib kelishi mumkin.
Yangi videolar va tahlillar uchun Youtube kanalimizga obuna bo‘ling









