AGI IS NEAR
21 აგვისტო, 2026

NVIDIA AVO-მ ARC-AGI-3-ის საჯარო ტესტზე 100% შედეგი აჩვენა

NVIDIA AVO-მ ARC-AGI-3-ის 25 საჯარო გარემოში 183-ვე დონე გაიარა და 100.00 RHAE ქულა მიიღო

NVIDIA AVO-მ, კომპანიის ზოგადი დანიშნულების AI აგენტმა, ინტერაქტიული აზროვნების ბენჩმარკ ARC-AGI-3-ის საჯარო ნაწილი სრულად გაიარა. სისტემამ 25 განსხვავებულ გარემოში არსებული 183 დონე დაასრულა და 100.00 RHAE ქულა მიიღო. დავალებების შესრულებისას აგენტს არ ჰქონდა თამაშის ინსტრუქციები, წინასწარ განსაზღვრული წესები ან პირდაპირ მითითებული მიზნები.

აგენტს გარემოსთან ურთიერთობით თავად უნდა გაერკვია, რა ხდებოდა, რას ცვლიდა თითოეული მოქმედება და როგორ შეიძლებოდა შემდეგ დონეზე გადასვლა. NVIDIA-ს ინფორმაციით, ეს შედეგი აჩვენებს, რომ ძლიერი AI აგენტის შესაქმნელად მხოლოდ მოწინავე ენობრივი მოდელი საკმარისი არ არის — არანაკლებ მნიშვნელოვანია მის გარშემო აგებული სრული სისტემა.

სარჩევი

როგორ მუშაობს NVIDIA AVO?

AVO — Agentic Variation Operators — ცალკეული AI მოდელი არ არის. ეს არის NVIDIA-ს მიერ შექმნილი აგენტური არქიტექტურა, რომელიც დიდ ენობრივ მოდელს მუდმივ მეხსიერებას, ინსტრუმენტებს, უკუკავშირის დამუშავებასა და ზედამხედველ მექანიზმს უმატებს.

NVIDIA AVO-ს შეუძლია დაათვალიეროს და შეცვალოს კოდი, შეასრულოს ბრძანებები, გამოიყენოს დოკუმენტაცია, ჩაატაროს ტესტები და მიღებული შედეგების მიხედვით საკუთარი მიდგომა შეცვალოს. მისი მთავარი თავისებურება ხანგრძლივ დავალებებზე მუშაობის უნარია — სისტემა ინარჩუნებს უკვე დაგროვებულ ინფორმაციას და ყოველი ახალი ნაბიჯისას ყველაფრის თავიდან გაანალიზება არ სჭირდება.

AVO მუდმივად იმეორებს ერთ ძირითად ციკლს: აგროვებს ინფორმაციას, აყალიბებს ჰიპოთეზას, მოქმედებს, ამოწმებს შედეგს და მიღებული გამოცდილებით მომდევნო ნაბიჯს გეგმავს. თუ პროგრესი შეჩერდება ან სისტემა ერთსა და იმავე წარუმატებელ მიდგომას იმეორებს, ზედამხედველი კომპონენტი მას სხვა სტრატეგიისკენ მიმართავს.

ARC-AGI-3-ის სრული საჯარო ტესტის დროს AVO-ს საფუძვლად Claude Opus 5 გამოიყენებოდა. შესაბამისად, 100%-იანი შედეგი NVIDIA-ს დამოუკიდებელ AI მოდელს არ ეკუთვნის — ის Claude Opus 5-ისა და NVIDIA-ს აგენტური არქიტექტურის ერთობლივი მუშაობით მიიღეს.

რა არის ARC-AGI-3?

ARC-AGI-3 ინტერაქტიული აზროვნების ბენჩმარკია, რომელიც ამოწმებს, რამდენად შეუძლია AI აგენტს სრულიად უცნობ გარემოში ორიენტირება, მოქმედებების შედეგების აღმოჩენა, მიზნის დამოუკიდებლად განსაზღვრა და რამდენიმე ნაბიჯით წინ დაგეგმვა.

ტრადიციული ბენჩმარკებისგან განსხვავებით, აქ აგენტს მზა კითხვაზე პასუხის გაცემა ან სტატიკური თავსატეხის ამოხსნა არ ევალება. ის უცნობ, თამაშის მსგავს გარემოში ხვდება და მოქმედებით უნდა შეისწავლოს მისი წესები. აგენტს არ ეუბნებიან, რა არის გამარჯვების პირობა ან რას აკეთებს თითოეული ხელმისაწვდომი მოქმედება.

ტესტი მხოლოდ დასრულებული დონეების რაოდენობას არ ითვლის. ARC-AGI-3 იყენებს RHAE-ს — Relative Human Action Efficiency-ს — რომელიც აფასებს, რამდენად ეფექტიანად ასრულებს სისტემა დავალებას იმ ადამიანებთან შედარებით, რომლებიც გარემოს პირველად ხედავენ. ამიტომ ზედმეტი და უშედეგო მოქმედებები საბოლოო შეფასებაზეც აისახება.

როგორ გაიარა AVO-მ 183 დონე?

NVIDIA AVO ბენჩმარკის გარემოებს გამოსახულებების სახით არ იღებდა. ყოველი მდგომარეობა სისტემას ზუსტი 64×64 ტექსტური ბადის ფორმით მიეწოდებოდა. ენობრივი მოდელისთვის არც სურათები და არც image token-ები გამოუყენებიათ.

აგენტმა ხელმისაწვდომი მოქმედებების ჩამონათვალი მიიღო, თუმცა მათი დანიშნულება აღწერილი არ ყოფილა. მოქმედებებსა და გარემოში მომხდარ ცვლილებებს შორის კავშირის აღმოჩენა AVO-ს თავად, თანმიმდევრული ექსპერიმენტებით მოუხდა.

საბოლოოდ NVIDIA AVO-მ 25 საჯარო გარემოში არსებული 183-ვე დონე 6,624 მოქმედებით გაიარა და 100.00 RHAE ქულა დააფიქსირა.

შედარებისთვის, VISTA-ს აგენტურ სისტემას იმავე Claude Opus 5-ის გამოყენებით საჯარო ნაკრების 183 დონის დასასრულებლად 7,542 მოქმედება დასჭირდა. NVIDIA-ს სისტემამ დაახლოებით 12%-ით ნაკლები მოქმედება გამოიყენა.

თუმცა კომპანია აღნიშნავს, რომ ეს სრულად კონტროლირებული შედარება არ არის. AVO და VISTA ერთმანეთისგან განსხვავდება მეხსიერების სისტემით, გარემოს წარმოდგენის ფორმით, კონტექსტის მართვითა და სხვა ტექნიკური კომპონენტებით. შესაბამისად, შედეგების სხვაობის მხოლოდ ერთი კონკრეტული მექანიზმით ახსნა შეუძლებელია.

რატომ არის NVIDIA AVO-ს შედეგი მნიშვნელოვანი?

ექსპერიმენტი მოდელსა და სრულფასოვან AI აგენტს შორის განსხვავებას უსვამს ხაზს. ენობრივი მოდელი აგენტის მთავარი კომპონენტია, თუმცა საბოლოო შესაძლებლობებზე გავლენას ახდენს მეხსიერება, ინსტრუმენტები, კონტექსტის მართვა, უკუკავშირი და შეცდომების შემდეგ მუშაობის გაგრძელების უნარი.

ARC Prize-ის მიერ ცალკე შეფასებული Claude Opus 5-ის შედეგი საჯარო ნაკრებზე დაახლოებით 30% იყო, ხოლო NVIDIA AVO-ს სრული სისტემის შემადგენლობაში იმავე მოდელის ოჯახმა 100% მიიღო. NVIDIA აფრთხილებს, რომ ეს პირდაპირი შედარება არ არის, რადგან განსხვავდებოდა მსჯელობის პარამეტრები, აგენტური სისტემა და შეფასების პირობები. მიუხედავად ამისა, შედეგი აჩვენებს, რამდენად დიდი გავლენა შეიძლება ჰქონდეს მოდელის გარშემო აგებულ არქიტექტურას.

AVO-მ ხანგრძლივი ავტონომიური მუშაობის შესაძლებლობა მანამდე GPU ბირთვების ოპტიმიზაციის დროსაც აჩვენა. სისტემა შვიდი დღის განმავლობაში მუშაობდა, შეისწავლა 500-ზე მეტი ოპტიმიზაციის მიმართულება და შექმნა კოდის 40 დასრულებული ვერსია. მიღებულმა attention kernel-ებმა NVIDIA DGX B200 სისტემებზე FlashAttention-4-ს გარკვეულ კონფიგურაციებში 10.5%-მდე აჯობა.

ნიშნავს თუ არა 100%-იანი შედეგი AGI-ის მიღწევას?

არა. NVIDIA-ს შედეგი მიღებულია ARC-AGI-3-ის საჯარო ნაკრებზე და არა ნახევრად დახურულ ან სრულად დახურულ საკონკურსო გარემოებში. თავად NVIDIA-ც მიუთითებს, რომ გამოქვეყნებული მონაცემები მხოლოდ 25 საჯარო გარემოს მოიცავს.

ARC Prize-ის ტექნიკური ანგარიშის მიხედვით, საჯარო გარემოები ბენჩმარკის დემონსტრირებისა და აგენტური სისტემების კვლევისთვისაა განკუთვნილი. ორგანიზაცია საჯარო ნაკრების შედეგებს AGI-ის პროგრესის ოფიციალურ მტკიცებულებად არ განიხილავს, რადგან ცნობილი გარემოების მიმართ სისტემის სპეციალურად მორგება შესაძლებელია და საჯარო ნაკრები დახურულ ტესტებზე მარტივია.

ამიტომ NVIDIA AVO-ს 100%-იანი შედეგი მნიშვნელოვანი საინჟინრო მიღწევაა, მაგრამ არ ადასტურებს, რომ ხელოვნური ზოგადი ინტელექტი უკვე შეიქმნა. ამის შესაფასებლად საჭიროა სისტემის გამოცდა ისეთ გარემოებშიც, რომლებიც მის შემქმნელებს წინასწარ არ უნახავთ.

რას ცვლის ეს AI აგენტებისთვის?

NVIDIA AVO გვიჩვენებს მიმართულებას, რომელშიც AI აგენტების განვითარება მოძრაობს. კონკურენცია მხოლოდ უფრო დიდი და ძლიერი მოდელების შექმნაზე აღარ იქნება დამოკიდებული. სულ უფრო მნიშვნელოვანი ხდება სრული სისტემის დიზაინი – მუდმივი მეხსიერება, ინსტრუმენტების გამოყენება, ზედამხედველობა, უკუკავშირის დამუშავება და ხანგრძლივი ამოცანების მართვა.

თუ მსგავსი არქიტექტურები უცნობ და დახურულ გარემოებშიც შეინარჩუნებენ ეფექტიანობას, AI აგენტები შეძლებენ უფრო რთული პროგრამული, სამეცნიერო და საინჟინრო სამუშაოების დამოუკიდებლად შესრულებას.

NVIDIA-ს ექსპერიმენტის მთავარი დასკვნა მარტივია: ძლიერი მოდელი აუცილებელია, მაგრამ მოდელი ჯერ კიდევ არ არის მთელი აგენტი.

AI გზამკვლევი რა არის ხელოვნური ინტელექტი? სრული გზამკვლევი: როგორ მუშაობს AI, რა არის LLM და რას ნიშნავს AGI - მარტივ ქართულში.

LLM.GE - გზამკვლევი ხელოვნურ ინტელექტში

LLM.GE არის ქართულ-ენოვანი პლატფორმა, რომელზეც ყოველდღიურად ქვეყნდება AI და ტექნოლოგიების სიახლეები, ახალი მოდელების, კვლევებისა და პრაქტიკული ინსტრუმენტების შესახებ. საიტის მიზანია, მკითხველმა ერთ სივრცეში მიიღოს ზუსტი, გასაგები და დროული ინფორმაცია ტექნოლოგიური ინდუსტრიის მთავარი მოვლენების შესახებ

გამოიწერე სიახლეები

გამოწერის გაუქმება ნებისმიერ დროს შეგიძლიათ Privacy Policy

×