კვლევითმა ჯგუფმა Impossible Research წარადგინა schema – ახალი ტიპის harness, რომელმაც ARC-AGI-3 ბენჩმარკის საჯარო ნაკრებზე თითქმის სრულყოფილი შედეგი აჩვენა. Claude Opus 4.8-ისა და Fable 5-ის კომბინაციით სისტემამ 98.98% RHAE მიიღო, ხოლო GPT-5.6 Sol-ით – 95.35%. შედარებისთვის, ARC Prize-ის მიერ ვერიფიცირებული საუკეთესო ოფიციალური შედეგი ამავე ნაკრებზე 13.33% იყო.
მთავარი დეტალი ის არის, რომ schema მოდელის წონებს საერთოდ არ ცვლის. ის ცვლის პროცესს მოდელის გარშემო – როგორ გარდაიქმნება დაკვირვებები თამაშის სამუშაო მოდელად, როგორ მოწმდება პროგნოზები რეალურ ისტორიასთან და როგორ სრულდება გეგმები. ავტორების ფორმულირებით, schema აიძულებს ენობრივ მოდელს, იფიქროს როგორც ფიზიკოსმა.
სარჩევი
რა არის ARC-AGI-3 და რატომ არის ის ასეთი რთული
ARC-AGI-3 აგენტს აძლევს სათამაშო გარემოს ყოველგვარი ახსნის გარეშე. ყოველ ნაბიჯზე აგენტი იღებს 64×64 ბადეს 16 ფერის ინდექსით და დაშვებული მოქმედებების ჩამონათვალს. არც ობიექტების სია არსებობს, არც წესების ფურცელი, არც გაცხადებული მიზანი.
აგენტმა თავად უნდა ჩამოაყალიბოს ჰიპოთეზები – რას წარმოადგენს ბადე, როგორ ცვლის მას მოქმედებები და რა ითვლება წარმატებად. შემდეგ კი ეს ჰიპოთეზები ახალ დაკვირვებებთან ერთად უნდა გადახედოს.
ბენჩმარკი frontier მოდელებისთვის გამორჩეულად რთული აღმოჩნდა. მარტში, გაშვებისას, საუკეთესო შედეგი 0.51% იყო. ივლისისთვის GPT-5.6 Sol-მა მაქსიმალური მსჯელობის რეჟიმში Semi-private ნაკრებზე 7.78%-ს მიაღწია, საჯაროზე კი 13.33%-ს. ადამიანის ეტალონამდე ორივე შორს იყო.
როგორ მუშაობს [schema] – ფიზიკოსის მიდგომა
სისტემის სახელი იმანუელ კანტისგან არის შთაგონებული: სქემა არის კონსტრუქციის წესი, რომელიც აბსტრაქტულ ცნებას კონკრეტულ აღქმასთან აკავშირებს.
schema ორ ამოცანას ერთდროულად წყვეტს. პირველი არის state grounding – ნედლი დაკვირვებების გარდაქმნა ობიექტებად, ცვლადებად და მიმართებებად. მეორე არის მექანიზმის აღმოჩენა – იმის დადგენა, როგორ იცვლება ეს მდგომარეობა მოქმედების შედეგად, და წესის ჩაწერა შესრულებადი პროგრამის სახით.
ორივე დონე ერთ რედაქტირებად პროგრამაშია გაერთიანებული. როცა დაკვირვება პროგნოზს ეწინააღმდეგება, აგენტს შეუძლია შეცვალოს ან წარმოდგენა, ან წესი. ავტორები ამას სპეციალურ ფარდობითობას ადარებენ: როცა პროგნოზები მუდმივად ცდება, ფიზიკოსები მხოლოდ კანონს კი არ ასწორებენ, არამედ იმასაც გადახედავენ, რა არის თავად მდგომარეობა.
ოთხსაფეხურიანი ციკლი
აგენტი მუშაობს ციკლში: დაკვირვება, განსჯა, შესრულება, ჩაწერა. ყოველი რეალური ტრანზაქცია უცვლელ ისტორიაში ინახება. განსჯის ეტაპზე აგენტი თამაშის თეორიას წერს step(state, action) პროგრამის სახით, ამოწმებს მას მთელ ჩაწერილ ისტორიაზე run_backtest ფუნქციით და გეგმას ეძებს მოდელის შიგნით run_bfs ძიებით.
მთავარი პრინციპი მარტივია – რეალობა მოდელზე მაღლა დგას. თუ შესრულებისას ერთი პროგნოზიც კი მცდარი აღმოჩნდა, მიმდინარე გეგმა უქმდება და აგენტი განსჯას უბრუნდება. ხოლო როცა მოდელი ისტორიის ყველა ტრანზაქციას ზუსტად იმეორებს, დაგეგმვა მოდელის შიგნით ხდება – რეალური მოქმედებების დახარჯვის გარეშე.
რას ამბობს ციფრები
RHAE მეტრიკა ადარებს აგენტის მოქმედებების რაოდენობას ადამიანის პირველი გაცნობის ეტალონთან. თანაფარდობა კვადრატში აჰყავთ, ამიტომ ზედმეტი მოქმედებები ქულას მკვეთრად ამცირებს. 98.98% სრულყოფილების და ეფექტიანობის ერთობლივი მაჩვენებელია და არა უბრალოდ ამოხსნილი თამაშების პროცენტი.
ყველაზე საინტერესო კონტროლირებული შედარებაა. იმავე Opus 4.8 და Fable 5 წყვილმა Anthropic-ის ზოგადი დანიშნულების Claude Code harness-ით 42.83% აჩვენა, [schema]-თი კი 98.98%. სხვაობა 56.15 პროცენტული პუნქტია და ის მთლიანად პროცესის ორგანიზებაზე მოდის, არა მოდელის შესაძლებლობებზე.
- Claude-ის წყვილით 25 თამაშიდან 19-მა ზუსტად 100 ქულა მიიღო
- 14 თამაშში, სადაც აგენტმა ისტორიის ზუსტად ამომხსნელი მოდელი ააგო, მან ადამიანზე 1.6-5-ჯერ ნაკლები მოქმედება გამოიყენა
- M0R0 თამაშის მე-4 დონეზე აგენტს 42 მოქმედება დასჭირდა, ადამიანს – 500
ცალკე დაკვირვება Fable 5-ს ეხება. წყვილ-წყვილად შედარებულ ჩანაწერებში Fable უფრო ხშირად აყენებდა ეჭვქვეშ თავად წარმოდგენას და ირჩევდა ისეთ ექსპერიმენტს, რომელიც კონკურენტ ჰიპოთეზებს ერთმანეთისგან განასხვავებდა. Opus ხშირად იმავე მექანიზმამდე მიდიოდა, ოღონდ მეტი მოქმედების ფასად.
მნიშვნელოვანი დათქმები
ორივე შედეგი – 98.98% და 95.35% – თვითდეკლარირებულია და ARC Prize-ს არ გადაუმოწმებია. გარდა ამისა, ყველა გაზომვა 25 საჯარო თამაშზეა ჩატარებული. რას მისცემდა [schema] Semi-private ნაკრებზე, უცნობია, სანამ არ გაიზომება – ავტორები ამას პირდაპირ აღნიშნავენ და ექსტრაპოლაციისგან თავს იკავებენ.
მიუხედავად ამისა, დასკვნა მაინც მნიშვნელოვანია: ის, თუ როგორ იყენებ მოდელს, შედეგზე უზარმაზარ გავლენას ახდენს. ავტორები გაჯერებულ ARC-AGI-3-ს ახალ დასაწყისად კითხულობენ – მექანიზმების აღმოჩენა, როგორც ზოგადი უნარი, ბევრად მდიდარ გარემოებშიც უნდა გადავიდეს, ვიდრე 64×64 ბადეა. სრული დეტალები ხელმისაწვდომია პროექტის გვერდზე.
განახლება: NVIDIA-ს AVO აგენტმა ARC-AGI-3-ის საჯარო ნაკრების 183-ვე დონე გაიარა. შედეგისა და მისი მნიშვნელობის შესახებ ვრცლად წაიკითხეთ სტატიაში: NVIDIA AVO-მ ARC-AGI-3-ზე 100% შედეგი აჩვენა.
სხვა თემები
კოლექტიური კიბერთავდაცვა: OpenAI-ის ღია წერილი
GlucoFM – Google-ის ახალი AI მოდელი
პერსონალიზებული mRNA კიბოს ვაქცინა Phase 3 კვლევაში წარმატებული აღმოჩნდა
