Google-მა წარადგინა Gemini 3.5 Live Translate – ახალი აუდიო მოდელი, რომელიც მეტყველებას თითქმის რეალურ დროში თარგმნის ერთი ენიდან მეორეზე. Gemini Live Translate 70-ზე მეტ ენას ცნობს და მთარგმნელობით ხმას ბუნებრივად, უხერხული პაუზების გარეშე აწარმოებს. ფუნქცია 2026 წლის 9 ივნისს ამოქმედდა და თანდათან ვრცელდება Google-ის რამდენიმე პროდუქტში.
ძველი სისტემებისგან განსხვავებით, რომლებიც საუბრის დასრულებას ელოდებიან და მხოლოდ მერე თარგმნიან, ეს მოდელი მეტყველებას უწყვეტად ამუშავებს. შედეგად, მთარგმნელი მოსაუბრეს მხოლოდ რამდენიმე წამით ჩამორჩება და თარგმანი საუბრის ტემპს ინარჩუნებს.
სარჩევი
როგორ მუშაობს Gemini 3.5 Live Translate
მოდელი 70-ზე მეტ ენას ავტომატურად ცნობს – მომხმარებელს ხელით პარამეტრების მითითება არ უწევს. თარგმნისას ის ინარჩუნებს მოსაუბრის ინტონაციას, ტემპსა და ხმის სიმაღლეს, რაც თარგმანს უფრო ცოცხალს ხდის.
მთავარი გამოწვევა აქ ბალანსია: უნდა დაელოდო კონტექსტს, რომ თარგმანი ზუსტი იყოს, თუ მაშინვე თარგმნო, რომ მოსაუბრეს არ ჩამორჩე. Google-ის განცხადებით, მოდელი სწორედ ამ ორ უკიდურესობას შორის ცდილობს ოპტიმალური წერტილის პოვნას.
მოდელი ასევე მდგრადია ხმაურის მიმართ, ანუ მუშაობს ხმაურიან, არაპროგნოზირებად გარემოშიც. ეს მნიშვნელოვანია ცოცხალი ზარების, შეხვედრების, გაკვეთილებისა და მაუწყებლობისთვის.
სად არის ხელმისაწვდომი Gemini Live Translate
ფუნქცია სამი მიმართულებით ვრცელდება:
- დეველოპერებისთვის – საჯარო წინასწარ ვერსიაში, Gemini Live API-ისა და Google AI Studio-ის გავლით.
- ბიზნესებისთვის – დახურულ წინასწარ ვერსიაში, ამ თვიდან, Google Meet-ში.
- ყველასთვის – Google Translate-ის აპლიკაციით Android-სა და iOS-ზე.
დეველოპერებს მოდელთან მუშაობა შეუძლიათ ისეთი პლატფორმების მეშვეობით, როგორებიცაა Agora, Fishjam, LiveKit, Pipecat და Vision Agents. ეს ინტეგრაციები რეალურ დროში მედია-ნაკადის რთულ ინფრასტრუქტურას თავად უმკლავდება, რაც დეველოპერებს მომხმარებლის გამოცდილებაზე ფოკუსირების საშუალებას აძლევს.
რატომ არის ეს მნიშვნელოვანი
Google-ში თარგმნა 20 წლის წინ დაიწყო, როგორც ერთ-ერთი პირველი მანქანური სწავლების ექსპერიმენტი. დღეს კომპანიის პროდუქტებში ყოველთვიურად ერთ ტრილიონზე მეტი სიტყვა ითარგმნება მილიონობით მომხმარებლისთვის.
ცოცხალი ხმოვანი თარგმანი ამ ისტორიის შემდეგი ნაბიჯია. ის ენობრივ ბარიერს არა ტექსტში, არამედ პირდაპირ საუბარში შლის, რაც ცვლის იმას, თუ როგორ ესაუბრებიან ერთმანეთს სხვადასხვა ენაზე მოლაპარაკე ადამიანები.
პრაქტიკული მაგალითიც უკვე არსებობს. კომპანია Grab მოდელს ტესტავს მძღოლებსა და მგზავრებს შორის მრავალენოვანი კომუნიკაციისთვის – ეს მომხმარებლები Grab-ში ყოველთვიურად 10 მილიონზე მეტ ხმოვან ზარს აკეთებენ.
დადებითი გამოხმაურება გაუზიარეს ისეთმა კომპანიებმაც, როგორებიცაა CJ ENM და LiveKit. ისინი გამოყოფენ თარგმანის ხარისხს, სიზუსტესა და დაბალ შეყოვნებას.
რას ნიშნავს ეს Google Meet-ისა და Translate-ისთვის
Google Meet-ში მეტყველების თარგმანი მალე Gemini 3.5 Live Translate-ზე გადავა. ეს რამდენიმე კონკრეტულ გაუმჯობესებას ნიშნავს:
- 70-ზე მეტი ენა, წინა ხუთი ენის ნაცვლად.
- ერთ შეხვედრაში 2000-ზე მეტი ენობრივი კომბინაცია, მაშინ როცა ადრე თარგმანი მხოლოდ ინგლისურში და ინგლისურიდან მუშაობდა.
- განახლებული ინტერფეისი, რომელიც თარგმანზე სწრაფ წვდომას იძლევა.
Google Translate-ის აპლიკაციაში Live translate ფუნქცია ნებისმიერ ყურსასმენთან მუშაობს და თარგმანში მოსაუბრის ტონს ინარჩუნებს.
უსაფრთხოება და SynthID
მოდელების მიერ შექმნილი ყველა აუდიო SynthID-ით აღინიშნება. ეს უხილავი წყალნიშანი პირდაპირ აუდიოში ჩაიქსოვება და AI-ით შექმნილ შინაარსს ამოსაცნობს ხდის, რაც დეზინფორმაციის თავიდან აცილებას ეხმარება.
დასკვნა
Gemini 3.5 Live Translate ხმოვან თარგმანს ტექსტური ხერხებიდან ცოცხალ, თითქმის რეალურ დროში საუბრისკენ წევს. 70-ზე მეტი ენა, ბუნებრივი ხმა და დაბალი შეყოვნება მას რეალურ ხელსაწყოდ აქცევს დეველოპერებისთვის, ბიზნესისთვის და ჩვეულებრივი მომხმარებლისთვის.
ნამდვილი ტესტი ის იქნება, თუ რამდენად კარგად იმუშავებს ფუნქცია ყოველდღიურ, ხმაურიან გარემოში, სადაც აქცენტები, ჟარგონი და სწრაფი მეტყველება უფრო რთულია. ფუნქცია უკვე ხელმისაწვდომია, ასე რომ პასუხს მალე დავინახავთ.
სხვა თემები
კოლექტიური კიბერთავდაცვა: OpenAI-ის ღია წერილი
GlucoFM – Google-ის ახალი AI მოდელი
პერსონალიზებული mRNA კიბოს ვაქცინა Phase 3 კვლევაში წარმატებული აღმოჩნდა
