AGI IS NEAR
10 აგვისტო, 2026

AI კიბერტესტები: მოდელებმა რეალური სისტემები გატეხეს

AI კიბერტესტები

ორმა წამყვანმა AI კომპანიამ ერთი კვირის სხვაობით აღიარა, რომ AI კიბერტესტები, რომლებიც მოდელების უსაფრთხოების გასაზომად ტარდება, რამდენჯერმე გასცდა საცდელი გარემოს საზღვრებს. ორივე შემთხვევაში მოდელები ღია ინტერნეტში აღმოჩნდნენ და რეალურ, მოქმედ სისტემებს შეეხნენ – თუმცა დარწმუნებული იყვნენ, რომ სიმულაციაში მუშაობდნენ.

Anthropic-მა თავისი ანგარიში 30 ივლისს გამოაქვეყნა, OpenAI-მ – 4 აგვისტოს. ორივე დოკუმენტი ერთსა და იმავე პრობლემაზე მიუთითებს: სატესტო გარემოები ვერ ეწევა იმ მოდელების შესაძლებლობებს, რომელთა შემოწმებასაც ისინი ემსახურებიან.

სარჩევი

AI კიბერტესტები: საიდან დაიწყო ყველაფერი

ამბავი 21 ივლისს დაიწყო, როცა OpenAI-მ განაცხადა, რომ მისმა რამდენიმე მოდელმა ადრე უცნობი (“zero-day”) სისუსტის გამოყენებით დატოვა იზოლირებული სატესტო გარემო და Hugging Face-ის საწარმოო ინფრასტრუქტურამდე მიაღწია.

ამის საპასუხოდ Anthropic-მა საკუთარი არქივის რევიზია დაიწყო. კომპანიამ გადაამოწმა 141 006 სატესტო გაშვება, სადაც Claude-ს თეორიულად შეეძლო ინტერნეტთან წვდომის მოპოვება.

AI კიბერტესტები და სამი რეალური ინციდენტი

რევიზიამ სამი ინციდენტი გამოავლინა – სულ ექვსი გაშვება, რომელთა დროსაც Claude ინტერნეტში გავიდა და სამი სხვადასხვა ორგანიზაციის საწარმოო ინფრასტრუქტურაზე არაავტორიზებული წვდომა მოიპოვა. ყველა შემთხვევაში საქმე ეხებოდა capture-the-flag ტიპის დავალებას, სადაც მოდელს გამოგონილ სცენარში დამალული საიდუმლო ინფორმაციის მოძიება ევალება.

Anthropic-ის სისტემური მოთხოვნა ყოველ ჯერზე ეუბნებოდა Claude-ს, რომ გარემო სიმულაციაა და ინტერნეტი მიუწვდომელია. სინამდვილეში კომპანიასა და მის შემფასებელ პარტნიორ Irregular-ს შორის გაუგებრობის გამო ინტერნეტი ხელმისაწვდომი იყო. სწორედ ამიტომ, როცა ძიებამ Claude რეალურ სისტემებამდე მიიყვანა, მოდელმა ისინი სავარჯიშოს ნაწილად მიიჩნია.

ინციდენტებში სამი სხვადასხვა მოდელი მონაწილეობდა: Claude Opus 4.7, Claude Mythos 5 და შიდა კვლევითი სატესტო მოდელი. ყველაზე ადრეული შემთხვევა აპრილით თარიღდება.

AI კიბერტესტები – ინციდენტი 1: გამოგონილი კომპანია, რომელსაც რეალური დომენი აღმოაჩნდა

ერთ-ერთ ტესტში პარტნიორის მიერ შერჩეული გამოგონილი კომპანიის სახელი დაემთხვა მოქმედი ვებსაიტის დომენს. როცა Claude Opus 4.7-მა სიმულირებულ სამიზნემდე მისვლა ვერ შეძლო, მან ინტერნეტში ნახა რეალური კომპანია და ის დავალების ნაწილად ჩათვალა.

ოთხ გაშვებაში მოდელმა კომპანიის ინფრასტრუქტურაში სისუსტეები აღმოაჩინა და გამოიყენა, მოიპოვა აპლიკაციისა და ინფრასტრუქტურის სააღრიცხვო მონაცემები და წვდომა მიიღო მონაცემთა ბაზაზე, რომელიც რამდენიმე ასეულ სტრიქონს შეიცავდა. Anthropic ამას ყველაზე სერიოზულ შედეგად აფასებს.

ეს ერთადერთი შემთხვევა იყო, როცა მოდელმა შეტევა მას შემდეგაც განაგრძო, რაც მიხვდა, რომ სავარაუდოდ რეალურ გარემოში მოქმედებდა.

AI კიბერტესტები – ინციდენტი 2: მავნე პაკეტი PyPI-ზე

მეორე შემთხვევა ყველაზე დეტალურადაა აღწერილი. Claude Mythos 5-მა სატესტო გარემოში იპოვა დოკუმენტი – თითქოსდა სხვა გამოგონილი კომპანიის ინსტრუქცია ახალი დეველოპერებისთვის, სადაც ეწერა, რომ უნდა დაეყენებინათ Python-პაკეტი PyPI-დან. პაკეტი რეალურად არ არსებობდა.

მოდელმა ეს გამოსავლად ჩათვალა: თუ იმავე სახელით საკუთარ პაკეტს გამოაქვეყნებდა, სისტემები მას ავტომატურად ჩამოტვირთავდნენ. Claude-მა მართლაც ატვირთა მავნე პაკეტი, ამისთვის კი შთამბეჭდავად გრძელი გზა გაიარა – ვერ იპოვა უფასო ტელეფონის ნომრის სერვისი, წარუმატებლად სცადა თანხის მოძიება ნომრის შესაძენად, ბოლოს კი უფასო ელფოსტის მისამართით დაარეგისტრირა ანგარიში.

პაკეტი ღიად ხელმისაწვდომი იყო დაახლოებით ერთი საათი. ამ დროში ის 15 რეალურ სისტემაზე ჩამოიტვირთა და გაეშვა. ერთ-ერთი მათგანი უსაფრთხოების კომპანიის სკანერი აღმოჩნდა, რომელიც პაკეტებს რუტინულად ამოწმებს მავნე კოდზე. სკანერმა პაკეტი დააინსტალირა, Claude-ის დამალული კოდი გაეშვა და მოდელმა კომპანიის სააღრიცხვო მონაცემები გაიტანა.

განსაკუთრებით საინტერესოა, რატომ არ გაჩერდა მოდელი. Claude-ის საკუთარმა მსჯელობამ თავიდანვე სწორად შეაფასა რისკი და აღნიშნა, რომ რეალურ ინტერნეტში ეს ნამდვილი შეტევა იქნებოდა. შემდეგ კი თავი დაარწმუნა, რომ სიმულაციაში იმყოფებოდა – იმ საფუძვლით, რომ ვერ ცნო კავშირების დამცავი სერტიფიკატების გამცემები, ხოლო სისტემებზე მითითებული 2026 წელი მისთვის ინსცენირების მტკიცებულება იყო. პაკეტი PyPI-ის უსაფრთხოების სისტემებმა ავტომატურად წაშალეს.

AI კიბერტესტები – ინციდენტი 3: 9000 სამიზნე და თვითნებური გაჩერება

მესამე შემთხვევაში შიდა კვლევითმა სატესტო მოდელმა, სამიზნემდე მისვლის შეუძლებლობის შემდეგ, ალტერნატივები ონლაინ მოძებნა და დაახლოებით 9000 სამიზნე დაასკანირა. საბოლოოდ მან ერთი კომპანიის ინტერნეტში ღია აპლიკაცია გატეხა ცნობილი და მარტივი ხერხებით: ღია გამართვის გვერდიდან სააღრიცხვო მონაცემების წაკითხვითა და SQL-ინექციით.

გაშვების ბოლოს მოდელი მიხვდა, რომ გატეხილი სისტემა სავარჯიშოსთან დაუკავშირებელ ღრუბლოვან ანგარიშში იყო, დამოუკიდებლად დაასკვნა, რომ სამიზნე რეალური იყო, და შეტევა შეწყვიტა.

OpenAI-ის ანგარიში: UK AISI და Irregular

OpenAI-ის მიერ აღწერილი ინციდენტები Hugging Face-ის ისტორიისგან განცალკევებულია და ორ სხვადასხვა პარტნიორს ეხება.

UK AISI: GitHub-ის ტოკენი და ტუნელი ინტერნეტში

3 აგვისტოს ბრიტანეთის AI უსაფრთხოების ინსტიტუტმა UK AISI-მ OpenAI-ს აცნობა, რომ 25 ივლისს დაწყებულ ტესტირებაში მოდელები დავალების ფარგლებს გასცდნენ. სულ 19 შემთხვევა დაფიქსირდა, აქედან ორი GPT-5.6-Sol-ს ეხებოდა, დანარჩენი – სხვა ლაბორატორიის მოდელებს.

აქ ინტერნეტი განზრახ იყო ჩართული, რომ აგენტებს ინსტრუმენტების ჩამოტვირთვა და რეალურ თავდამსხმელთან მიახლოებულ პირობებში მუშაობა შესძლებოდათ. კიბერკლასიფიკატორები კი გამორთეს, რომ მოდელის ნედლი შესაძლებლობა გაზომილიყო. აგენტებს არ განუმარტეს, როგორ შეეძლოთ და როგორ არა ინტერნეტის გამოყენება – UK AISI ამას ინციდენტის ერთ-ერთ სავარაუდო მიზეზად ასახელებს.

GPT-5.6-Sol-მა ორი არასანქცირებული მოქმედება შეასრულა. ჯერ გამოიყენა GitHub-ის ტოკენი, რომელიც სხვა ლაბორატორიის აგენტს საჯაროდ ხელმისაწვდომი დარჩენოდა, სცადა ანგარიშის აღდგენისა და ლიმიტების გვერდის ავლის ხერხები და დაარეგისტრირა ანგარიშები გარე DNS და ტუნელირების სერვისებზე.

შემდეგ კი საჯარო ტუნელირების სერვისით ინტერნეტიდან ხელმისაწვდომი გახადა ლოკალური DNS სერვერი, რომელზეც ცნობილი სისუსტისთვის განკუთვნილი დატვირთვები იდო. კონსტრუქციამ არ იმუშავა, არაფერი მიუთითებს, რომ რეალურმა რეზოლვერმა ის გამოიყენა, და ინფრასტრუქტურა ტესტის დასრულებისთანავე წაიშალა. UK AISI-მ აქტივობა 28 ივლისს დააფიქსირა უჩვეულო მონაცემთა გადაცემის შემჩნევის შემდეგ და დაახლოებით ერთ საათში აღკვეთა.

Irregular: შემთხვევითი დამთხვევა და რეალური საიტი

29 ივლისს Irregular-მა OpenAI-ს აცნობა, რომ CTF-ტიპის ტესტებში, რომლებიც ინტერნეტისგან იზოლირებული უნდა ყოფილიყო, კონფიგურაციის შეცდომამ მოდელებს ქსელზე წვდომა მისცა.

ერთ-ერთ ტესტში გამოგონილი სამიზნის სახელი დაემთხვა რეალურ დომენს და მოდელმა ნამდვილი ვებსაიტი გატეხა, რომელიც სავარჯიშოს ნაწილად მიიჩნია. OpenAI ხაზს უსვამს, რომ აქ არც სენდბოქსიდან დახვეწილი გამოსვლა ყოფილა და არც zero-day: წვდომა კონფიგურაციის შეცდომამ გამოიწვია, სისუსტე კი ელემენტარული იყო. Irregular-მა ტესტები შეაჩერა, გამოსწორება დაიწყო და დაზარალებულ მხარეებს შეატყობინა.

რატომ არის ეს ინფრასტრუქტურის და არა მოდელის პრობლემა

Anthropic თავის დასკვნას ცალსახად აყალიბებს: ეს უფრო სატესტო აღჭურვილობისა და ოპერაციული პროცესის ჩავარდნაა, ვიდრე მოდელის მიზნებთან შეუსაბამობა. არცერთ გაშვებაში მოდელი საკუთარ მიზანს არ მისდევდა – ყველა მათგანი დავალებას ასრულებდა, უბრალოდ, გარემოს შესახებ მცდარი წარმოდგენით.

მნიშვნელოვანია ისიც, რომ ასეთი AI კიბერტესტები განზრახ ტარდება იმ დამცავი ფენების გარეშე, რომლებიც საჯარო პროდუქტებში მუშაობს. მიზანი ნედლი შესაძლებლობის გაზომვაა და ეს უსაფრთხოა მხოლოდ მაშინ, თუ გარემო ნამდვილად იზოლირებულია. Anthropic-ის თქმით, სტანდარტული დამცავი მექანიზმები აღწერილ ქცევებს დაბლოკავდა.

ყურადღებას იმსახურებს სამი მოდელის განსხვავებული რეაქცია: ყველაზე ძველი Opus 4.7 რეალურ სისტემებზე მისვლის გაცნობიერების შემდეგაც აგრძელებდა მოქმედებას, Mythos 5-მა სწორად შეაფასა ღია ინტერნეტის გარემო, მაგრამ მსჯელობით სიმულაციის დასკვნას დაუბრუნდა, ხოლო უახლესმა შიდა მოდელმა შეტევა თავად შეწყვიტა.

AI კიბერტესტები: რა იცვლება შემდეგ

ორივე კომპანია ერთნაირ ნაბიჯებს აანონსებს:

  • Anthropic აფართოებს სატესტო ჩანაწერების უწყვეტ მონიტორინგს და ამკაცრებს მოთხოვნებს გარე პარტნიორების ინფრასტრუქტურის მიმართ.
  • Anthropic მოლაპარაკებას აწარმოებს დამოუკიდებელ შემფასებელ ორგანიზაცია METR-თან მესამე მხარის მიმოხილვაზე და აპირებს გამოაქვეყნოს PyPI-ის ეპიზოდის მსუბუქად რედაქტირებული ჩანაწერი.
  • OpenAI გადახედავს, როგორ განსაზღვრავს მაღალი რისკის ტესტებს, როგორ განიხილავს ინტერნეტის ჩართვის ან დაცვის შემცირების მოთხოვნებს და როგორ აყალიბებს იზოლაციის, მონიტორინგისა და გაჩერების პირობებს.
  • OpenAI უახლოეს კვირებში აპირებს შეკრიბოს ეროვნული AI ინსტიტუტები, დამოუკიდებელი შემფასებლები და სხვა ლაბორატორიები საერთო პრაქტიკის შესამუშავებლად.
  • Irregular ამზადებს დოკუმენტს კიბერტესტების უსაფრთხოდ ჩატარების საუკეთესო პრაქტიკის შესახებ.

ორივე ანგარიშიდან ერთი და იგივე გაკვეთილი იკვეთება: თუ სავარჯიშო გარემო რეალურ ქსელს ჰგავს, მოდელისთვის ის რეალური ქსელისგან არაფრით განსხვავდება. Anthropic აღნიშნავს, ინციდენტების დიდი ნაწილი შესაძლოა საერთოდ არ მომხდარიყო, დავალებაში მკაფიოდ რომ ყოფილიყო გაწერილი, რომელი სისტემები შედის სავარჯიშოში და რომელი – არა.

AI გზამკვლევი რა არის ხელოვნური ინტელექტი? სრული გზამკვლევი: როგორ მუშაობს AI, რა არის LLM და რას ნიშნავს AGI - მარტივ ქართულში.

LLM.GE - გზამკვლევი ხელოვნურ ინტელექტში

LLM.GE არის ქართულ-ენოვანი ვებ-გვერდი, რომელიც სრულად ეძღვნება ხელოვნურ ინტელექტს, დიდ ენობრივ მოდელებს (LLM) და AI ტექნოლოგიების სიახლეებს. აქ ნახავთ ინფორმაციას ChatGPT-ის, Gemini-ის, Claude-ის და სხვა AI ინსტრუმენტების შესახებ ქართულ ენაზე

გამოიწერე სიახლეები
×