ჩინურმა ხელოვნური ინტელექტის კომპანიამ Z.AI-მ, რომელიც ჩინეთში Zhipu AI-ის სახელით არის ცნობილი და GLM მოდელების სერიას ქმნის, GLM-5.3 წარადგინა. ახალი მოდელი ძირითადად კოდირებაზე, AI აგენტებსა და კიბერუსაფრთხოებაზეა ორიენტირებული და 743 მილიარდი პარამეტრის მქონე საბაზო მოდელს ეფუძნება.
მოდელი 743 მილიარდი პარამეტრის მქონე საბაზო მოდელს ეფუძნება, ხოლო შესაძლებლობების გაუმჯობესება დამატებითი წვრთნის, ანუ post-training-ის ეტაპზე მოხდა.
სარჩევი
Z.AI-ის განცხადებით, განახლებამ კოდირების შედეგები მნიშვნელოვნად გააუმჯობესა და კიბერუსაფრთხოების ტესტებში მოულოდნელად ძლიერი შესაძლებლობებიც გამოავლინა. თუმცა გამოქვეყნებული შედეგები ძირითადად კომპანიის მიერ ჩატარებულ შეფასებებს ეყრდნობა და დამოუკიდებელი ტესტებით დადასტურებას ჯერ კიდევ საჭიროებს.
რა შეიცვალა GLM-5.3-ში?
GLM-5.3 სრულიად ახალ საბაზო მოდელზე არ არის აგებული. Z.AI-მ არსებული 743B საბაზო მოდელის post-training გააფართოვა და ყურადღება პრაქტიკულ, ხანგრძლივ და მრავალსაფეხურიან დავალებებზე გადაიტანა.
ეს მიდგომა განსაკუთრებით მნიშვნელოვანია AI აგენტებისთვის. ასეთ სისტემას მხოლოდ კოდის ცალკეული მონაკვეთის დაწერა არ ევალება – მან უნდა გაიგოს პროექტის მოთხოვნები, იმუშაოს ფაილებთან და ინსტრუმენტებთან, შეამოწმოს მიღებული შედეგი და რამდენიმე ნაბიჯის განმავლობაში შეინარჩუნოს დავალების კონტექსტი.
Z.AI-ის ტექნიკური ბლოგის მიხედვით, ახალი მოდელი ღია წონების კოდირების მოდელებს შორის მოწინავე შედეგებს აჩვენებს. კომპანიამ ასევე განაცხადა, რომ საკუთარ Z.ai Code Bench ტესტში GLM-5.2-თან შედარებით დაახლოებით 50%-იანი გაუმჯობესება მიიღო.
GLM-5.3-ის კოდირების შედეგები
Z.AI-მ მოდელი რამდენიმე კოდირებისა და აგენტური მუშაობის ტესტზე შეაფასა. გამოქვეყნებული მონაცემების მიხედვით, ყველაზე დიდი სხვაობა იმ დავალებებში გამოჩნდა, რომლებიც ტერმინალთან მუშაობას, პროგრამული პროექტის ცვლილებასა და მრავალსაფეხურიან მოქმედებებს მოითხოვს.
- Terminal-Bench 3.0: შედეგი GLM-5.2-ის 4.6-დან GLM-5.3-ის 28.3-მდე გაიზარდა.
- DeepSWE v1.1: მაჩვენებელი 46.2-დან 66.9-მდე გაუმჯობესდა.
- Agents’ Last Exam: შედეგი 23.8-დან 28.5-მდე გაიზარდა.
DeepSWE v1.1 გრძელვადიან პროგრამულ დავალებებზე მომუშავე AI აგენტებს ამოწმებს. ამიტომ ამ ტესტში მიღებული შედეგი უფრო მეტად პროექტის დონეზე მუშაობას ასახავს, ვიდრე მოკლე კოდის გენერაციას.
მიუხედავად თვალსაჩინო სხვაობისა, ტესტის ქულა რეალურ სამუშაო გარემოში ავტომატურად იმავე ხარისხს არ ნიშნავს. საბოლოო შეფასებისთვის მნიშვნელოვანია დამოუკიდებელი ტესტები, კოდის სიზუსტე, შეცდომების სიხშირე, მუშაობის სიჩქარე და გამოყენების ღირებულებაც.
GLM-5.3 და კიბერუსაფრთხოება
Z.AI-ის განცხადების ყველაზე საინტერესო ნაწილი კიბერუსაფრთხოებას ეხება. კომპანიის აღწერით, post-training-ის მასშტაბის გაზრდასთან ერთად მოდელის კიბერუსაფრთხოების შესაძლებლობები მოსალოდნელზე სწრაფად განვითარდა.
CyberGym-ზე, რომელიც AI აგენტებს რეალური პროგრამული მოწყვლადობების ანალიზში ამოწმებს, GLM-5.3-მა 84.5-ის შედეგი აჩვენა. შედარებისთვის, GLM-5.2-ის მაჩვენებელი 77.2 იყო. Z.AI ამ შედეგს მოწყვლადობების აღმოჩენის მიმართულებით საუკეთესო მაჩვენებლად აღწერს.
კიდევ უფრო დიდი სხვაობა დაფიქსირდა ExploitGym-ზე. ეს ტესტი აფასებს, რამდენი ექსპლუატაციის დავალების შესრულება შეუძლია მოდელს დროის გათანაბრებული ლიმიტის პირობებში.
Z.AI-ის მონაცემებით, ახალმა მოდელმა ორ საათში 105, ხოლო ექვს საათში 130 დავალება შეასრულა. GLM-5.2-ის შესაბამისი შედეგები 29 და 39 დავალება იყო.
ამ შესაძლებლობებს ორმაგი დანიშნულება აქვს. მათი გამოყენება შესაძლებელია ავტორიზებული უსაფრთხოების ტესტირებისთვის, პროგრამული ხარვეზების მოსაძებნად და დაცვის გასაძლიერებლად, თუმცა იგივე ტექნიკური შესაძლებლობები ბოროტად გამოყენების რისკსაც ქმნის. სწორედ ამიტომ კიბერუსაფრთხოების მაღალი ქულები ავტომატურად არ უნდა განვიხილოთ მხოლოდ როგორც ჩვეულებრივი პროდუქტის უპირატესობა.
API ცვლილებები და GLM-5.3-ის გამოყენება
ახალ ვერსიაში შეიცვალა მსჯელობის ინტენსივობის მართვაც. GLM-5.3 მხარს უჭერს სამ დონეს – low, high და max. მოდელში მსჯელობის სრულად გამორთვა აღარ არის მხარდაჭერილი, რაც API ინტეგრაციის განახლებისას დეველოპერებმა უნდა გაითვალისწინონ.
მოდელი ხელმისაწვდომია ZCode-ში, რომელიც Z.AI-ის აგენტური პროგრამირების გარემოა. ოფიციალური დოკუმენტაციის თანახმად, GLM Coding Plan-ის ყველა გეგმა მხარს უჭერს GLM-5.3-ს.
რას ნიშნავს GLM-5.3-ის გამოშვება?
GLM-5.3 აჩვენებს, რომ მოდელის შესაძლებლობების შესამჩნევად გაუმჯობესება ყოველთვის ახალი და უფრო დიდი საბაზო მოდელის შექმნას არ მოითხოვს. Z.AI-მ მთავარი პროგრესი უკვე არსებული 743B მოდელის დამატებითი წვრთნით მიიღო და ცვლილებები კოდირების, ხანგრძლივი აგენტური დავალებებისა და კიბერუსაფრთხოების მიმართულებით გაამახვილა.
ამ ეტაპზე ყველაზე მნიშვნელოვანი საკითხი დამოუკიდებელი შეფასებებია. თუ Z.AI-ის მონაცემები სხვა ტესტებშიც დადასტურდება, GLM-5.3 ღია წონების კოდირების მოდელებს შორის ერთ-ერთი მნიშვნელოვანი ახალი არჩევანი იქნება. საბოლოო სურათი კი მოდელის წონების, ლიცენზიისა და პრაქტიკული ტესტების გამოქვეყნების შემდეგ გახდება ნათელი.
სხვა თემები
ფულის გამომუშავება ხელოვნური ინტელექტით – ექვსი გზა
AI-ინსტრუმენტები სოციალური მედიისთვის – Top 10
ხელოვნური ინტელექტი ქართულად: რომელი AI ჯობს (?!)
