AGI HAS ARRIVED
1 ოქტომბერი, 2026

Gemini 4 Argon – Google-ის ახალი მოდელი

Gemini 4 Argon – Google-ის ახალი მოდელი

Google-მა ახალი მოდელი, Gemini 4 Argon წარადგინა. კომპანიის თქმით, მოდელი შექმნილია იმისთვის, რომ რთულ, მრავალეტაპიან ამოცანებზე ღრმა მსჯელობა დიდხანს შეინარჩუნოს. მთავარი მიმართულებებია პროგრამული ინჟინერია, იურიდიული და ფინანსური სამუშაო და კიბერთავდაცვა.

ანონსი Google DeepMind-ის უფროსმა ვიცე-პრეზიდენტმა და Google-ის მთავარმა AI არქიტექტორმა, კორაი კავუკჩუოღლუმ Google-ის ბლოგზე გამოაქვეყნა. ფართო საზოგადოებისთვის მოდელი ჯერ ხელმისაწვდომი არ არის.

სარჩევი

რა არის Gemini 4 Argon

Gemini 4 Argon გათვლილია გრძელ სამუშაო პროცესებზე, სადაც მოდელს ბევრი ნაბიჯის შესრულება და ერთ ამოცანაზე დიდხანს ფოკუსირება უწევს. Google-ის სიტყვებით, მოდელი უკვე ცვლის იმას, თუ როგორ მუშაობენ და რას აშენებენ კომპანიის შიგნით.

Google ამბობს, რომ Argon ძლიერია კოდირებაში, მსჯელობაში, მულტიმოდალურ ამოცანებში და შემოქმედებით წერაშიც.

გამომავალი ტოკენების ლიმიტი 1 მილიონამდე

ერთ-ერთი ყველაზე თვალსაჩინო ცვლილება გამომავალი ტოკენების ლიმიტს ეხება. Gemini 4 Argon-ს ერთ პასუხში 1 მილიონამდე ტოკენის გენერირება შეუძლია, მაშინ როცა წინა ლიმიტი 64 ათასი ტოკენი იყო. Google ამ მაჩვენებელს ინდუსტრიაში ყველაზე მაღალს უწოდებს.

კომპანიის ახსნით, როცა მოდელს საკმარისი სივრცე აქვს ასიათასობით ტოკენის ფარგლებში „იფიქროს“, რთულ პრობლემას ერთი მცდელობით ხსნის და მსჯელობაც უფრო სიღრმისეული გამოდის.

როგორ იყენებს Google მოდელს შიდა სამუშაოში

Google-ის ცნობით, Gemini 4 Argon-ით კომპანიაში უკვე ათასობით თანამშრომელი სარგებლობს. ისინი განსაკუთრებით აღნიშნავენ მოდელის ძალას სპეციალიზებულ კოდირებაში, სიღრმისეულ კვლევასა და წერის ხარისხში. ბლოგპოსტში რამდენიმე კონკრეტული მაგალითია მოყვანილი:

  • კვანტური ალგორითმები: Argon ეხმარება Google-ის კვანტური გამოთვლების მკვლევრებს, შეამცირონ ქვეპროგრამების რესურსული ხარჯი (კუბიტები × გეითები). ერთ შემთხვევაში მოდელმა გამოქვეყნებულ საბაზისო შედეგს რამდენიმე წუთში 40%-ით აჯობა.
  • მეხსიერების ოპტიმიზაცია: Argon-ის აგენტების ჯგუფმა Google-ის დატა-ცენტრების პროფილირების მონაცემები გააანალიზა და ოპტიმიზაციები დამოუკიდებლად განახორციელა. შედეგად 300 ტებიბაიტზე მეტი მეხსიერება გათავისუფლდა, ხოლო მთლიანი დაზოგვა 500 ტებიბაიტიდან 1 პებიბაიტამდე არის შეფასებული.
  • კოდის მიგრაცია Rust-ზე: Argon-ის აგენტები C/C++ კოდს Rust-ზე გადაიტანენ. სამუშაოს მასშტაბი მერყეობს ათიათასობით ხაზიდან ისეთ ბიბლიოთეკებში, როგორიცაა re2 და libgav1, Fuchsia-ს Zircon ბირთვის 800 ათასზე მეტ ხაზამდე.

Google განმარტავს, რომ ამ სისტემების მნიშვნელობიდან გამომდინარე, ასეთი მასშტაბური გადაწერა პროდუქციაში გაშვებამდე ავტომატურ და ხელით აუდიტს, ემულაციურ ტესტირებასა და მიმოხილვას გადის.

libgav1-ის მაგალითი

libgav1 Google-ის ღია კოდის ვიდეო დეკოდერია. Argon-ის აგენტებმა მისი არსებული Rust-ვერსია აიღეს და SIMD კოდის 32 ათასი ხაზი ჩაანაცვლეს უსაფრთხო Rust კოდით, რომელსაც კომპილატორი ავტომატურად ავექტორებს. ამისთვის აგენტებმა პროფილირებაზე დაფუძნებული ექსპერიმენტების მრავალი რაუნდი ჩაატარეს და კომპილატორის გამონატანს სწავლობდნენ.

შედეგად მიიღეს მეხსიერების თვალსაზრისით უსაფრთხო დეკოდერი, რომელიც წინა Rust-ვერსიაზე 2.7-ჯერ სწრაფია, იდენტური ვიდეო შედეგით. Google-ის თქმით, ეს მას ოპტიმიზებულ C++ ვერსიას უახლოვებს.

Gemini 4 Argon პროგრამირებასა და კორპორატიულ ამოცანებში

Google-ის ინჟინრები Argon-ს ყოველდღიური დებაგინგიდან დაწყებული, კოდის ბაზების მასშტაბური მიგრაციითა და ალგორითმების დიზაინით დამთავრებული, სხვადასხვა ამოცანისთვის იყენებენ. DeepSWE v1.1 ბენჩმარკზე, რომელიც რეალურ და გრძელვადიან პროგრამულ ამოცანებს აფასებს, მოდელმა 77.9% აჩვენა, რაც კომპანიის მონაცემებით ახალი რეკორდია.

კოდის მიღმა, Google-ის თქმით, Argon ლიდერობს Vals Index-ში. ეს ინდექსი ფინანსებში, კოდირებაში, სამართალსა და საგადასახადო სამუშაოში მოდელის ეკონომიკურ გავლენას ზომავს, თითოეული სექტორის წონა კი აშშ-ის მშპ-ში მის წილს შეესაბამება.

კომპანია ლიდერ პოზიციებს ასახელებს სხვა დარგობრივ შეფასებებზეც:

  • Vals Finance Agent v2 – მრავალეტაპიანი ფინანსური კვლევა.
  • Harvey-ს Legal Agent Benchmark – იურიდიული კვლევა და დოკუმენტების შედგენა.
  • AutomationBench – Zapier-ის ბენჩმარკი ბიზნეს-პროცესების ბოლომდე შესრულებაზე, სადაც Argon 51.3%-ით პირველ ადგილზეა.

ვიზუალური ინფორმაციის გაგება

Google ცალკე გამოყოფს ვიზუალურ ამოცანებს. Argon-ს შეუძლია პროფესიული დიაგრამების ანალიზი, გრძელ ვიდეოებში დეტალების პოვნა და დოკუმენტების სერიაზე დაყრდნობით მოქმედება. LVBench ბენჩმარკზე, რომელიც გრძელი ვიდეოების გაგებას ზომავს, მოდელმა 91.7% აჩვენა.

კიბერთავდაცვა – Argon-ის ერთ-ერთი მთავარი მიმართულება

Google-მა Gemini 4 Argon კიბერთავდაცვისთვის სპეციალურად გაწვრთნა. მოდელს შეუძლია კრიტიკული მოწყვლადობების დამოუკიდებლად პოვნა, გადამოწმება და გასწორება.

სანდო დამცველებისა და Google-ის შიდა გუნდებისთვის კომპანია Argon-ს კიბერშეზღუდვების გარეშე გამოუშვებს, რათა მათ მოდელის სრული შესაძლებლობების გამოყენება შეძლონ. სწორედ ამიტომ, პირველ ეტაპზე მოდელი Fairwind Program-ის მონაწილეებზე ვრცელდება.

Wiz და Scan for Good

Wiz Argon-ს უკვე იყენებს Scan for Good ინიციატივაში, რომელიც კრიტიკულ საჯარო ინფრასტრუქტურას უფასოდ იცავს. Google-ის თქმით, მოდელმა აღმოაჩინა კრიტიკული მოწყვლადობა ჯანდაცვის პროგრამულ უზრუნველყოფაში, რომელსაც მსოფლიოს სხვადასხვა საავადმყოფო იყენებს. ხარვეზი პაციენტების სენსიტიურ პერსონალურ მონაცემებს საფრთხეს უქმნიდა, წინა ფრონტირ მოდელებს კი ის გამორჩათ.

ბენჩმარკები

CWE-bench v1-ზე, რომელიც მოწყვლადობების გასწორების უნარს აფასებს, Argon-მა 68% აჩვენა და პირველი ადგილი გაიყო. Google ასევე აღნიშნავს, რომ მოწყვლადობების აღმოჩენაში ახალი მოდელი წინა Gemini 3.8 Flash Cyber-ს საგრძნობლად ჯობნის:

  • Google-ის შიდა ბენჩმარკზე Argon-მა 20 პროგრამირების ენაზე დაწერილ რთულ კოდის ბაზებში მოწყვლადობების ფართო სპექტრი გამოავლინა.
  • Wiz-ის შიდა black-box პენტესტ ბენჩმარკზე, სადაც მოდელი ცოცხალ ვებსისტემებს წყარო კოდის გარეშე აანალიზებს, Argon 3.8 Flash Cyber-ს აჯობებს შეტევის ზედაპირის აღმოჩენაში, მოწყვლადობების იდენტიფიცირებასა და proof-of-concept მტკიცებულებების მომზადებაში.

argon benchmarks

უსაფრთხოების ზომები ფართო გაშვებამდე

Google ამბობს, რომ ამ დონის შესაძლებლობების მქონე მოდელის გამოშვება ეტაპობრივ მიდგომას მოითხოვს. კომპანია აშშ-ის მთავრობის ნებაყოფლობით პროცესშიც მონაწილეობს, რომელიც მოდელებზე გამოშვებამდე წვდომას გულისხმობს. ფართო ხელმისაწვდომობამდე Google უსაფრთხოებას ოთხი მიმართულებით აძლიერებს:

  • ბოროტად გამოყენების პრევენცია: მოდელი უარს ამბობს კიბერ და CBRN (ქიმიური, ბიოლოგიური, რადიოლოგიური და ბირთვული) შეტევებთან დაკავშირებულ მავნე მოთხოვნებზე, თუმცა ლეგიტიმურ სამეცნიერო კვლევას ხელს არ უშლის. ეს Frontier Safety Framework-ს შეესაბამება. Google ასევე ხვეწს მოდელის შიდა აქტივაციების მონიტორინგს ბოროტად გამოყენების გამოსავლენად.
  • prompt injection შეტევებისგან დაცვა: Google-ის თქმით, Argon კომპანიის ყველაზე მდგრადი მოდელია არაპირდაპირი prompt injection-ის მიმართ და Gray Swan-ის შესაბამის ბენჩმარკზე ლიდერობს.
  • შეუსაბამო ქცევის მონიტორინგი: სისტემა აკვირდება მოდელის მსჯელობის ჯაჭვს (chain-of-thought) და ქმედებებს, საჭიროების შემთხვევაში კი შესრულებას აჩერებს, თუ მოდელი მომხმარებლის განზრახვის ფარგლებს სცდება.
  • სისტემების გამაგრება: მაღალი რისკის ტრენინგამდე და შეფასებებამდე Google იზოლირებულ სატესტო გარემოებს ჰერმეტულად კეტავს.

აღსანიშნავია, რომ Google მონიტორინგის შედეგებს ტრენინგში განზრახ არ აბრუნებს, რათა მოდელმა მეთვალყურეობისგან თავის არიდება არ ისწავლოს. კომპანია ინდუსტრიას მოუწოდებს, მოდელების მსჯელობის გამჭვირვალობა შეინარჩუნონ.

Gemini 4 Argon-ის ფასი და ხელმისაწვდომობა

საწყის ეტაპზე Argon-ის ფასი იქნება $2 მილიონ შემავალ ტოკენზე და $10 მილიონ გამომავალ ტოკენზე. ქეშირებული შემავალი ტოკენები 95%-ით იაფი ღირს. საწყისი პერიოდის დასრულების შემდეგ ფასი გაიზრდება $4-მდე შემავალ და $20-მდე გამომავალ ტოკენებზე (მილიონზე).

კონკრეტული თარიღი Google-ს არ დაუსახელებია. კომპანია ამბობს, რომ ადრეული ტესტერების უკუკავშირის საფუძველზე დამცავ მექანიზმებს დახვეწს და შემდეგ Gemini 4 Argon-ს დეველოპერებისთვის, კომპანიებისა და მომხმარებლებისთვის გახსნის. პირველები ფასიანი API-ს მომხმარებლები და Google AI Ultra-ს გამომწერები იქნებიან.

AI წაიკითხე მეტი როგორ მუშაობს ხელოვნური ინტელექტი AI-ის, დიდი ენობრივი მოდელებისა და ნეირონული ქსელების ახსნა ქართულ ენაზე.

LLM.GE - გზამკვლევი ხელოვნურ ინტელექტში

LLM.GE არის ქართულ-ენოვანი პლატფორმა, რომელზეც ყოველდღიურად ქვეყნდება AI და ტექნოლოგიების სიახლეები, ახალი მოდელების, კვლევებისა და პრაქტიკული ინსტრუმენტების შესახებ. საიტის მიზანია, მკითხველმა ერთ სივრცეში მიიღოს ზუსტი, გასაგები და დროული ინფორმაცია ტექნოლოგიური ინდუსტრიის მთავარი მოვლენების შესახებ

გამოიწერე სიახლეები

გამოწერის გაუქმება ნებისმიერ დროს შეგიძლიათ Privacy Policy

×