Google-მა ახალი მოდელი, Gemini 4 Argon წარადგინა. კომპანიის თქმით, მოდელი შექმნილია იმისთვის, რომ რთულ, მრავალეტაპიან ამოცანებზე ღრმა მსჯელობა დიდხანს შეინარჩუნოს. მთავარი მიმართულებებია პროგრამული ინჟინერია, იურიდიული და ფინანსური სამუშაო და კიბერთავდაცვა.
ანონსი Google DeepMind-ის უფროსმა ვიცე-პრეზიდენტმა და Google-ის მთავარმა AI არქიტექტორმა, კორაი კავუკჩუოღლუმ Google-ის ბლოგზე გამოაქვეყნა. ფართო საზოგადოებისთვის მოდელი ჯერ ხელმისაწვდომი არ არის.
სარჩევი
- რა არის Gemini 4 Argon
- გამომავალი ტოკენების ლიმიტი 1 მილიონამდე
- როგორ იყენებს Google მოდელს შიდა სამუშაოში
- Gemini 4 Argon პროგრამირებასა და კორპორატიულ ამოცანებში
- კიბერთავდაცვა – Argon-ის ერთ-ერთი მთავარი მიმართულება
- უსაფრთხოების ზომები ფართო გაშვებამდე
- Gemini 4 Argon-ის ფასი და ხელმისაწვდომობა
- სხვა თემები
რა არის Gemini 4 Argon
Gemini 4 Argon გათვლილია გრძელ სამუშაო პროცესებზე, სადაც მოდელს ბევრი ნაბიჯის შესრულება და ერთ ამოცანაზე დიდხანს ფოკუსირება უწევს. Google-ის სიტყვებით, მოდელი უკვე ცვლის იმას, თუ როგორ მუშაობენ და რას აშენებენ კომპანიის შიგნით.
Google ამბობს, რომ Argon ძლიერია კოდირებაში, მსჯელობაში, მულტიმოდალურ ამოცანებში და შემოქმედებით წერაშიც.
გამომავალი ტოკენების ლიმიტი 1 მილიონამდე
ერთ-ერთი ყველაზე თვალსაჩინო ცვლილება გამომავალი ტოკენების ლიმიტს ეხება. Gemini 4 Argon-ს ერთ პასუხში 1 მილიონამდე ტოკენის გენერირება შეუძლია, მაშინ როცა წინა ლიმიტი 64 ათასი ტოკენი იყო. Google ამ მაჩვენებელს ინდუსტრიაში ყველაზე მაღალს უწოდებს.
კომპანიის ახსნით, როცა მოდელს საკმარისი სივრცე აქვს ასიათასობით ტოკენის ფარგლებში „იფიქროს“, რთულ პრობლემას ერთი მცდელობით ხსნის და მსჯელობაც უფრო სიღრმისეული გამოდის.
როგორ იყენებს Google მოდელს შიდა სამუშაოში
Google-ის ცნობით, Gemini 4 Argon-ით კომპანიაში უკვე ათასობით თანამშრომელი სარგებლობს. ისინი განსაკუთრებით აღნიშნავენ მოდელის ძალას სპეციალიზებულ კოდირებაში, სიღრმისეულ კვლევასა და წერის ხარისხში. ბლოგპოსტში რამდენიმე კონკრეტული მაგალითია მოყვანილი:
- კვანტური ალგორითმები: Argon ეხმარება Google-ის კვანტური გამოთვლების მკვლევრებს, შეამცირონ ქვეპროგრამების რესურსული ხარჯი (კუბიტები × გეითები). ერთ შემთხვევაში მოდელმა გამოქვეყნებულ საბაზისო შედეგს რამდენიმე წუთში 40%-ით აჯობა.
- მეხსიერების ოპტიმიზაცია: Argon-ის აგენტების ჯგუფმა Google-ის დატა-ცენტრების პროფილირების მონაცემები გააანალიზა და ოპტიმიზაციები დამოუკიდებლად განახორციელა. შედეგად 300 ტებიბაიტზე მეტი მეხსიერება გათავისუფლდა, ხოლო მთლიანი დაზოგვა 500 ტებიბაიტიდან 1 პებიბაიტამდე არის შეფასებული.
- კოდის მიგრაცია Rust-ზე: Argon-ის აგენტები C/C++ კოდს Rust-ზე გადაიტანენ. სამუშაოს მასშტაბი მერყეობს ათიათასობით ხაზიდან ისეთ ბიბლიოთეკებში, როგორიცაა re2 და libgav1, Fuchsia-ს Zircon ბირთვის 800 ათასზე მეტ ხაზამდე.
Google განმარტავს, რომ ამ სისტემების მნიშვნელობიდან გამომდინარე, ასეთი მასშტაბური გადაწერა პროდუქციაში გაშვებამდე ავტომატურ და ხელით აუდიტს, ემულაციურ ტესტირებასა და მიმოხილვას გადის.
libgav1-ის მაგალითი
libgav1 Google-ის ღია კოდის ვიდეო დეკოდერია. Argon-ის აგენტებმა მისი არსებული Rust-ვერსია აიღეს და SIMD კოდის 32 ათასი ხაზი ჩაანაცვლეს უსაფრთხო Rust კოდით, რომელსაც კომპილატორი ავტომატურად ავექტორებს. ამისთვის აგენტებმა პროფილირებაზე დაფუძნებული ექსპერიმენტების მრავალი რაუნდი ჩაატარეს და კომპილატორის გამონატანს სწავლობდნენ.
შედეგად მიიღეს მეხსიერების თვალსაზრისით უსაფრთხო დეკოდერი, რომელიც წინა Rust-ვერსიაზე 2.7-ჯერ სწრაფია, იდენტური ვიდეო შედეგით. Google-ის თქმით, ეს მას ოპტიმიზებულ C++ ვერსიას უახლოვებს.
Gemini 4 Argon პროგრამირებასა და კორპორატიულ ამოცანებში
Google-ის ინჟინრები Argon-ს ყოველდღიური დებაგინგიდან დაწყებული, კოდის ბაზების მასშტაბური მიგრაციითა და ალგორითმების დიზაინით დამთავრებული, სხვადასხვა ამოცანისთვის იყენებენ. DeepSWE v1.1 ბენჩმარკზე, რომელიც რეალურ და გრძელვადიან პროგრამულ ამოცანებს აფასებს, მოდელმა 77.9% აჩვენა, რაც კომპანიის მონაცემებით ახალი რეკორდია.
კოდის მიღმა, Google-ის თქმით, Argon ლიდერობს Vals Index-ში. ეს ინდექსი ფინანსებში, კოდირებაში, სამართალსა და საგადასახადო სამუშაოში მოდელის ეკონომიკურ გავლენას ზომავს, თითოეული სექტორის წონა კი აშშ-ის მშპ-ში მის წილს შეესაბამება.
კომპანია ლიდერ პოზიციებს ასახელებს სხვა დარგობრივ შეფასებებზეც:
- Vals Finance Agent v2 – მრავალეტაპიანი ფინანსური კვლევა.
- Harvey-ს Legal Agent Benchmark – იურიდიული კვლევა და დოკუმენტების შედგენა.
- AutomationBench – Zapier-ის ბენჩმარკი ბიზნეს-პროცესების ბოლომდე შესრულებაზე, სადაც Argon 51.3%-ით პირველ ადგილზეა.
ვიზუალური ინფორმაციის გაგება
Google ცალკე გამოყოფს ვიზუალურ ამოცანებს. Argon-ს შეუძლია პროფესიული დიაგრამების ანალიზი, გრძელ ვიდეოებში დეტალების პოვნა და დოკუმენტების სერიაზე დაყრდნობით მოქმედება. LVBench ბენჩმარკზე, რომელიც გრძელი ვიდეოების გაგებას ზომავს, მოდელმა 91.7% აჩვენა.
კიბერთავდაცვა – Argon-ის ერთ-ერთი მთავარი მიმართულება
Google-მა Gemini 4 Argon კიბერთავდაცვისთვის სპეციალურად გაწვრთნა. მოდელს შეუძლია კრიტიკული მოწყვლადობების დამოუკიდებლად პოვნა, გადამოწმება და გასწორება.
სანდო დამცველებისა და Google-ის შიდა გუნდებისთვის კომპანია Argon-ს კიბერშეზღუდვების გარეშე გამოუშვებს, რათა მათ მოდელის სრული შესაძლებლობების გამოყენება შეძლონ. სწორედ ამიტომ, პირველ ეტაპზე მოდელი Fairwind Program-ის მონაწილეებზე ვრცელდება.
Wiz და Scan for Good
Wiz Argon-ს უკვე იყენებს Scan for Good ინიციატივაში, რომელიც კრიტიკულ საჯარო ინფრასტრუქტურას უფასოდ იცავს. Google-ის თქმით, მოდელმა აღმოაჩინა კრიტიკული მოწყვლადობა ჯანდაცვის პროგრამულ უზრუნველყოფაში, რომელსაც მსოფლიოს სხვადასხვა საავადმყოფო იყენებს. ხარვეზი პაციენტების სენსიტიურ პერსონალურ მონაცემებს საფრთხეს უქმნიდა, წინა ფრონტირ მოდელებს კი ის გამორჩათ.
ბენჩმარკები
CWE-bench v1-ზე, რომელიც მოწყვლადობების გასწორების უნარს აფასებს, Argon-მა 68% აჩვენა და პირველი ადგილი გაიყო. Google ასევე აღნიშნავს, რომ მოწყვლადობების აღმოჩენაში ახალი მოდელი წინა Gemini 3.8 Flash Cyber-ს საგრძნობლად ჯობნის:
- Google-ის შიდა ბენჩმარკზე Argon-მა 20 პროგრამირების ენაზე დაწერილ რთულ კოდის ბაზებში მოწყვლადობების ფართო სპექტრი გამოავლინა.
- Wiz-ის შიდა black-box პენტესტ ბენჩმარკზე, სადაც მოდელი ცოცხალ ვებსისტემებს წყარო კოდის გარეშე აანალიზებს, Argon 3.8 Flash Cyber-ს აჯობებს შეტევის ზედაპირის აღმოჩენაში, მოწყვლადობების იდენტიფიცირებასა და proof-of-concept მტკიცებულებების მომზადებაში.

უსაფრთხოების ზომები ფართო გაშვებამდე
Google ამბობს, რომ ამ დონის შესაძლებლობების მქონე მოდელის გამოშვება ეტაპობრივ მიდგომას მოითხოვს. კომპანია აშშ-ის მთავრობის ნებაყოფლობით პროცესშიც მონაწილეობს, რომელიც მოდელებზე გამოშვებამდე წვდომას გულისხმობს. ფართო ხელმისაწვდომობამდე Google უსაფრთხოებას ოთხი მიმართულებით აძლიერებს:
- ბოროტად გამოყენების პრევენცია: მოდელი უარს ამბობს კიბერ და CBRN (ქიმიური, ბიოლოგიური, რადიოლოგიური და ბირთვული) შეტევებთან დაკავშირებულ მავნე მოთხოვნებზე, თუმცა ლეგიტიმურ სამეცნიერო კვლევას ხელს არ უშლის. ეს Frontier Safety Framework-ს შეესაბამება. Google ასევე ხვეწს მოდელის შიდა აქტივაციების მონიტორინგს ბოროტად გამოყენების გამოსავლენად.
- prompt injection შეტევებისგან დაცვა: Google-ის თქმით, Argon კომპანიის ყველაზე მდგრადი მოდელია არაპირდაპირი prompt injection-ის მიმართ და Gray Swan-ის შესაბამის ბენჩმარკზე ლიდერობს.
- შეუსაბამო ქცევის მონიტორინგი: სისტემა აკვირდება მოდელის მსჯელობის ჯაჭვს (chain-of-thought) და ქმედებებს, საჭიროების შემთხვევაში კი შესრულებას აჩერებს, თუ მოდელი მომხმარებლის განზრახვის ფარგლებს სცდება.
- სისტემების გამაგრება: მაღალი რისკის ტრენინგამდე და შეფასებებამდე Google იზოლირებულ სატესტო გარემოებს ჰერმეტულად კეტავს.
აღსანიშნავია, რომ Google მონიტორინგის შედეგებს ტრენინგში განზრახ არ აბრუნებს, რათა მოდელმა მეთვალყურეობისგან თავის არიდება არ ისწავლოს. კომპანია ინდუსტრიას მოუწოდებს, მოდელების მსჯელობის გამჭვირვალობა შეინარჩუნონ.
Gemini 4 Argon-ის ფასი და ხელმისაწვდომობა
საწყის ეტაპზე Argon-ის ფასი იქნება $2 მილიონ შემავალ ტოკენზე და $10 მილიონ გამომავალ ტოკენზე. ქეშირებული შემავალი ტოკენები 95%-ით იაფი ღირს. საწყისი პერიოდის დასრულების შემდეგ ფასი გაიზრდება $4-მდე შემავალ და $20-მდე გამომავალ ტოკენებზე (მილიონზე).
კონკრეტული თარიღი Google-ს არ დაუსახელებია. კომპანია ამბობს, რომ ადრეული ტესტერების უკუკავშირის საფუძველზე დამცავ მექანიზმებს დახვეწს და შემდეგ Gemini 4 Argon-ს დეველოპერებისთვის, კომპანიებისა და მომხმარებლებისთვის გახსნის. პირველები ფასიანი API-ს მომხმარებლები და Google AI Ultra-ს გამომწერები იქნებიან.
სხვა თემები
გუგლ ჯემინაი-მ ტესტირებისას სამი კომპანიის სისტემა გატეხა
Gemini 3.8 Live: ახალი ხმოვანი AI მოდელები
Gemini – რა არის, როგორ მუშაობს და რა შეუძლია
