AGI HAS ARRIVED
16 სექტემბერი, 2026

Gemini 3.8 Live: ახალი ხმოვანი AI მოდელები

Gemini 3.8 Live და Extended Thinking: 97 ენა, ფონური დავალებები, ტესტების შედეგები და ხელმისაწვდომობა

Google-მა Gemini 3.8 Live და Gemini 3.8 Live Extended Thinking წარადგინა. Google DeepMind-ის ახალი აუდიომოდელები ბუნებრივი ხმოვანი დიალოგისთვის, AI-სთან თანამშრომლობისა და რთული დავალებების საუბრის გზით შესასრულებლად შეიქმნა.

განახლების ერთ-ერთი მთავარი შესაძლებლობა საუბრის პარალელურად მუშაობაა: მოდელს შეუძლია მომხმარებელს ესაუბროს და ამავე დროს ფონურად დავალებას ასრულებდეს. ახალი მოდელები განკუთვნილია როგორც Google-ის პროდუქტებისთვის, ისე დეველოპერებისა და კომპანიებისთვის, რომლებიც საკუთარ ხმოვან ასისტენტებს ქმნიან.

სარჩევი

რით განსხვავდება Gemini 3.8 Live და Extended Thinking?

Gemini 3.8 Live – მასშტაბური გამოყენება და ხარჯების ეფექტიანობა

სტანდარტული ვერსია გათვლილია ხმოვან აპლიკაციებზე, რომლებმაც დიდი მოცულობის მოთხოვნები ეფექტიანად უნდა დაამუშაონ. Google აქ ყურადღებას ამახვილებს ბუნებრივი დიალოგის, მსჯელობის შესაძლებლობებისა და შედარებით დაბალი ხარჯების შეთავსებაზე.

ეს მიდგომა მნიშვნელოვანია საკუთარი ხმოვანი აგენტების შემქმნელებისთვის, რომლებსაც საუბრის ხარისხთან ერთად მომსახურების მასშტაბიც აინტერესებთ. მოდელი თითქმის რეალურ დროში ურთიერთობისთვის არის ოპტიმიზებული.

Extended Thinking – უფრო რთული, მრავალსაფეხურიანი ამოცანები

Gemini 3.8 Live Extended Thinking უფრო რთულ მსჯელობასა და რამდენიმე ეტაპისგან შემდგარ დავალებებზეა ორიენტირებული. მას შეუძლია ერთდროულად იმუშაოს ამოცანაზე და მომხმარებელს შესრულების მიმდინარეობის შესახებ ესაუბროს.

ასეთ შემთხვევაში მომხმარებელი პროცესის დასრულებამდე მხოლოდ საბოლოო პასუხს არ ელოდება. მოდელი საუბრისას აცნობებს, რომ მოთხოვნას ამუშავებს და სამუშაოს წინსვლის შესახებ ინფორმაციას აწვდის.

ვიზუალური კონტექსტი და 97 ენის მხარდაჭერა

ხმასთან ერთად ახალი მოდელები ვიზუალურ ინფორმაციასაც იყენებენ. გამოსახულების გააზრება მათ ეხმარება, საუბრისას დამატებითი კონტექსტი გაითვალისწინონ და პასუხი იმასთან დააკავშირონ, რასაც მომხმარებელი აჩვენებს.

Google-ის განცხადებით, Gemini 3.8 Live 97 მხარდაჭერილ ენას ავტომატურად ამოიცნობს. მოდელს საუბრის მიმდინარეობისას ერთი ენიდან მეორეზე გადასვლაც შეუძლია.

Google DeepMind-ის აღწერაში ყურადღება ეთმობა მოსმენასაც: მოდელები განასხვავებენ უშუალოდ მათკენ მიმართულ საუბარს ფონური ლაპარაკისგან. მიზანია, ხმოვანმა აგენტმა საუბრის რიტმი გაითვალისწინოს და საჭირო მომენტში უპასუხოს.

კიდევ ერთი აქცენტი ასოებისა და ციფრების შემცველი მონაცემების დამუშავებაა. მაგალითად, ტელეფონის ნომრების, შეკვეთის იდენტიფიკატორებისა და ელფოსტის მისამართების სწორად გაგება მნიშვნელოვანია მომხმარებელთა მომსახურებისას.

დავალებების შესრულება საუბრის შეწყვეტის გარეშე

მოდელებს შეუძლიათ ფონურად გამოიყენონ ინსტრუმენტები და სხვა სისტემებს მიმართონ, სანამ მომხმარებელთან დიალოგს აგრძელებენ. ამგვარად, მოთხოვნის დამუშავება და საუბარი პარალელურად მიმდინარეობს.

ეს შესაძლებლობა განსაკუთრებით გამოსადეგია მრავალსაფეხურიან პროცესებში, როდესაც ერთ მოქმედებას რამდენიმე შემდგომი ნაბიჯი მოსდევს. ხმოვან აგენტს შეუძლია სამუშაო გააგრძელოს და მომხმარებელს პროცესის შესახებ ინფორმაცია მიაწოდოს.

რა აჩვენა Google-მა დემონსტრაციებში?

ერთ მაგალითში Extended Thinking ესკიზებისა და ხმოვანი მითითებების საფუძველზე React-ის ფუნქციურ კომპონენტებს ქმნის. სხვა დემონსტრაციაში ის მრავალსაფეხურიან დაჯავშნასა და ფონურ მოქმედებებს კოორდინაციას უწევს, საუბრის გაგრძელების პარალელურად.

რა შედეგები აჩვენეს მოდელებმა ტესტებში?

Google-ის მიერ გამოქვეყნებული მონაცემებით, Extended Thinking ვერსიამ Artificial Analysis-ის Speech to Speech Quality Index-ში პირველი ადგილი დაიკავა. კომპანიამ შემდეგი შედეგები გამოაქვეყნა:

  • Speech to Speech Quality Index – 82.6 ქულა.
  • τ-Voice – 68.6%.
  • Sierra-ს τ-Voice-banking – 35.1%.
  • Big Bench Audio – 97.7%.

ცალკე, მომხმარებელთა შეფასებებზე დაფუძნებულ Speech Agent Arena-ში, Google სტანდარტული Gemini 3.8 Live-ის მეორე ადგილზეც მიუთითებს. ეს რეიტინგი და ზემოთ ჩამოთვლილი ტესტები ერთმანეთისგან განსხვავებული შეფასებებია.

რა ტიპის ინფორმაციასთან მუშაობენ ახალი მოდელები?

ტექნიკური ბარათის მიხედვით, ორივე მოდელი Gemini 3 Pro-ს ეფუძნება. მათ შეუძლიათ აუდიოს, გამოსახულების, ვიდეოსა და ტექსტის მიღება, პასუხად კი აუდიოსა და ტექსტის შექმნა.

მითითებულია 128K ტოკენამდე კონტექსტის ფანჯარა და 64K ტოკენის მოცულობის გამომავალი პასუხი. ეს ტექნიკური მახასიათებლები განსაზღვრავს, რა მოცულობის ინფორმაციის გათვალისწინება და პასუხის გენერირება შეუძლია მოდელს.

სად იქნება ხელმისაწვდომი ახალი ხმოვანი მოდელები?

Google-ის განცხადებით, გავრცელება 2026 წლის 15 სექტემბერს დაიწყო. ხელმისაწვდომობის პირობები პროდუქტებისა და მომხმარებელთა ჯგუფების მიხედვით განსხვავდება:

  • დეველოპერებისთვის – ორივე მოდელის გავრცელება დაიწყო Gemini API-სა და Google AI Studio-ში.
  • კომპანიებისთვის – Gemini Enterprise-ში გათვალისწინებულია დახურული წინასწარი წვდომა. Gemini Enterprise for Customer Experience-ში დამატება მოგვიანებითაა დაგეგმილი.
  • მომხმარებლებისთვის – სტანდარტული ვერსია ინერგება Search Live-ში, Extended Thinking კი Gemini Live-ში.

Google Workspace-ში Extended Thinking-ის გავრცელება Docs-ისთვის Google AI Pro და Ultra აბონენტებით იწყება. Gmail-სა და Keep-ში ის Google AI-ის ყველა სააბონენტო გეგმის მომხმარებლისთვისაა გათვალისწინებული.

Workspace-ის ბიზნესმომხმარებლებისთვის Extended Thinking-ის შეთავაზება მოგვიანებით იგეგმება. შესაბამისად, მოდელების წარდგენა ყველა პროდუქტში ერთდროულ ხელმისაწვდომობას არ ნიშნავს.

AI გზამკვლევი რა არის ხელოვნური ინტელექტი? სრული გზამკვლევი: როგორ მუშაობს AI, რა არის LLM და რას ნიშნავს AGI - მარტივ ქართულში.

LLM.GE - გზამკვლევი ხელოვნურ ინტელექტში

LLM.GE არის ქართულ-ენოვანი პლატფორმა, რომელზეც ყოველდღიურად ქვეყნდება AI და ტექნოლოგიების სიახლეები, ახალი მოდელების, კვლევებისა და პრაქტიკული ინსტრუმენტების შესახებ. საიტის მიზანია, მკითხველმა ერთ სივრცეში მიიღოს ზუსტი, გასაგები და დროული ინფორმაცია ტექნოლოგიური ინდუსტრიის მთავარი მოვლენების შესახებ

გამოიწერე სიახლეები

გამოწერის გაუქმება ნებისმიერ დროს შეგიძლიათ Privacy Policy

×