კომპანია Tavus-მა წარადგინა Griffin – მოდელი, რომელიც, კომპანიის თქმით, პირველი მოდელია, რომელმაც ვიდეო ტიურინგის ტესტი გაიარა. ცოცხალ ექსპერიმენტში Griffin-თან ერთწუთიანი ვიდეოზარის შემდეგ მონაწილეების 48%-მა ჩათვალა, რომ რეალურ ადამიანს ესაუბრებოდა. Tavus-ის წინა სისტემის შემთხვევაში ეს მაჩვენებელი 2.4% იყო.
ტესტი ჩაატარა Griffin-Lite-მა, რომელიც ჯერჯერობით მხოლოდ შერჩეული ტესტერებისთვისაა ხელმისაწვდომი. უფრო ძლიერ ვერსიას კომპანია მოგვიანებით გამოუშვებს.
სარჩევი
რა არის Griffin
Tavus მის ახალ პროდუქტს პირველ Human Interaction Model-ს (HIM) უწოდებს. ეს არის მოდელების ახალი კლასი, რომელიც პირისპირ საუბარს რეალურ დროში აღიქვამს და თავადაც ქმნის. ის უსმენს იმ დროსაც, როცა თავად ლაპარაკობს და ყურადღებას აქცევს არა მხოლოდ სიტყვებს, არამედ სახის გამომეტყველებასა და პაუზებსაც.
ის აერთიანებს Tavus-ის ადრინდელ კვლევებს, რომლებიც აქამდე ცალკეულ მოდელებად არსებობდა: Phoenix-4.5 სახის გენერაციისთვის, Raven-1 აღქმისთვის და Sparrow-2 საუბრის რიგითობის მართვისთვის. ახლა ეს ყველაფერი ერთ, ერთიან video-to-video სისტემაშია.
ვიდეო ტიურინგის ტესტი: როგორ ჩატარდა ექსპერიმენტი
მონაწილეები დამოუკიდებელი კვლევითი პლატფორმის მეშვეობით შეარჩიეს. მათ უთხრეს, რომ ერთწუთიანი ვიდეოზარით სხვა მონაწილეს დაუკავშირდებოდნენ და ისაუბრებდნენ იმაზე, რას ელიან ამ წელს. სინამდვილეში მეორე მხარეს იყო Griffin-Lite-ზე მომუშავე ციფრული პერსონაჟი, რომლის სახე, ხმა და პასუხები რეალურ დროში იქმნებოდა.
ზარის შემდეგ მონაწილეებმა შეაფასეს საუბარი და პარტნიორი. მხოლოდ კითხვარის ბოლოს ჰკითხეს, ხომ არ გაუჩნდათ ეჭვი, რომ ადამიანს არ ესაუბრებოდნენ. ბოლოს ყველა მონაწილეს აცნობეს, რომ ხელოვნურ ინტელექტთან ჰქონდათ საქმე.
შედეგები
- Griffin-Lite: 54 მონაწილიდან 26-მა (48%) ჩათვალა, რომ რეალურ ადამიანს ესაუბრებოდა.
- Phoenix-4.5 + Sparrow-2 + Raven-1: 41 მონაწილიდან მხოლოდ ერთმა (2.4%).
- ორივე ჯგუფი საკუთარ პასუხში დარწმუნებული იყო: ვინც ადამიანი თქვა, საშუალოდ 79%-ით, ვინც AI – 81%-ით.
- მონაწილეების ნახევარზე მეტს ეჭვიც კი არ გასჩენია. ვისაც გაუჩნდა, ძირითადად პირველ 20 წამში.
7-ქულიან სკალაზე Griffin-Lite-მა ბუნებრიობისთვის 5.4 მიიღო, სანდოობისთვის 5.6, ხოლო კითხვაზე, ისურვებდნენ თუ არა მასთან კვლავ საუბარს – 5.8. ყველაზე დაბალი ქულა, 4.9, საუბრის ბუნებრივ დინებას ერგო.
როგორ მუშაობს
რეალურ დროში მომუშავე AI სისტემების უმეტესობა ჯაჭვივით არის აწყობილი: ერთი მოდელი მეტყველებას ტექსტად აქცევს, ენობრივი მოდელი პასუხს წერს, სხვები კი ამ პასუხს ხმად და სახედ გარდაქმნიან. Tavus-ის თქმით, ყოველი ასეთი გადაცემა დაყოვნებას ამატებს და ინფორმაციას კარგავს, მაგალითად, ხმის ტონს ან იმას, რაც კამერაში ჩანს.
საუბარი, რომელიც რიგს არ ელოდება
Griffin ე.წ. full-duplex მოდელია. ის საუბრის მდგომარეობას წამზე მცირე ინტერვალებით აფასებს და ყოველ ჯერზე წყვეტს, ილაპარაკოს, უბრალოდ თავი დაუქნიოს თუ დაელოდოს. ამიტომ შეუძლია მოსაუბრის შეწყვეტა, თავად შეწყვეტილი იყოს ისე, რომ აზრი არ დაკარგოს, და ფიქრისთვის გაკეთებული პაუზა საუბრის დასრულებად არ მიიღოს.
მოდელი არა მხოლოდ ხმას, არამედ ვიდეოსაც აღიქვამს. ეს საშუალებას აძლევს წაიკითხოს მზერა და გამომეტყველება, დაინახოს გარემო ან ის, რასაც მომხმარებელი ეკრანზე უზიარებს.
ხმის გენერაცია
Griffin-Lite-ის ხმის გენერაცია ავტორეგრესიულ დიფუზიურ ტრანსფორმერს ეფუძნება, რომელიც მეტყველებას ნაწილ-ნაწილ ქმნის და წინადადების დასრულებას არ ელოდება. ხმის კლონირებისთვის დაახლოებით 10-წამიანი ჩანაწერი საკმარისია. აუდიოს წარმოსადგენად Tavus იყენებს საკუთარ კოდეკს Tavec-ს, რომელიც აუდიოს 10 მილიწამის ზომის პაკეტებით გამოსცემს.
ვიდეოს გენერაცია
Griffin ერთი საწყისი ფოტოდან რეალურ დროში ქმნის 720p ვიდეოს 320 მილიწამიანი ნაწილებით. ის აკონტროლებს მთელ კადრს: სახეს, ხელებს, თითებს, სკამის მოძრაობას, ჩრდილებს და ფონსაც. Tavus-ის წინა მოდელები 3D ფორმებზე იყო დამოკიდებული, რაც ხელის დიდ ჟესტებსა და დინამიკურ ფონს გამორიცხავდა.
H100 გრაფიკულ პროცესორებზე დრო, რომელიც აუდიოს მიღებიდან ვიდეოში რეაქციის გამოჩენამდე გადის, საშუალოდ 0.43 წამი იყო – ორჯერ ნაკლები, ვიდრე შედარებულ მოდელებს შორის ყველაზე სწრაფის შემთხვევაში. ვიდეოს ხარისხის მეტრიკებში (DOVER, FID და THEval) Griffin-Lite პირველი იყო, ტუჩების სინქრონიზაციაში (LSE-C) კი მეორე.
NVIDIA-ს VideoFDB ბენჩმარკზე
VideoFDB NVIDIA-ს ბენჩმარკია, რომელიც აფასებს, რამდენად ბუნებრივად და ზუსტად წარმართავს მოდელი აუდიო-ვიზუალურ საუბარს. შეფასებას NVIDIA დამოუკიდებლად ატარებს ორ მიმართულებაში: გენერაცია და აღქმა. შედეგები 2026 წლის სექტემბერში დაითვალა.
- გენერაცია: Griffin-Lite-მა 5-დან 3.83 ქულა მიიღო. ადამიანის საორიენტაციო შედეგი 3.92-ია, შემდეგი საუკეთესო სისტემის (Gemini 2.5 + Anam) – 2.80.
- აღქმა: 3.73 ქულა 15 შეფასებულ მოდელს შორის საუკეთესო შედეგია. ადამიანის მაჩვენებელი 4.20-ია, მეორე ადგილზე მყოფი MiniCPM-o 4.5-ის კი 3.44.
- საუბარში ჩართვის დრო: რამდენად ემთხვევა მოდელის გადაწყვეტილება, როდის ილაპარაკოს, რეალურ საუბრებს – 62.8% გენერაციაში და 73.8% აღქმაში, ორივე მიმართულებით საუკეთესო.
რა შეუძლია Griffin-ს პრაქტიკაში
Tavus-ის მიერ გამოქვეყნებულ დემონსტრაციებში Griffin ადამიანს რუბიკის კუბის აწყობაში ეხმარება: აკვირდება, როგორ ატრიალებს კუბს და როცა მოსაუბრე ჩერდება, ელოდება, სანამ ის მზად არ იქნება. სხვა მაგალითში დედაპლატის შედუღებისას ხელმძღვანელობს მომხმარებელს და სიტყვას მაშინ იღებს, როცა შემდეგი ნაბიჯის დროა, და არა უბრალოდ მაშინ, როცა ადამიანი გაჩუმდება.
დემოებში ჩანს ისიც, როგორ თამაშობს „Simon Says“-ს და ჟესტს მხოლოდ მაშინ იმეორებს, როცა ეს სიტყვები ითქმის. ერთად ისტორიის მოფიქრებისას კი Griffin და ადამიანი ერთმანეთს აწყვეტინებენ სიტყვას ისე, რომ თხრობის ძაფი არ წყდება.
Tavus-ის ხედვით, მსგავსი მოდელები შეიძლება გამოდგეს რეპეტიტორად, რომელიც ამჩნევს, რომ ახსნა არ გესმის და სხვა გზას ცდის, რთული საუბრის წინასწარ გასავარჯიშებლად, ან მომხმარებლის მხარდაჭერისთვის, როცა ადამიანი გაფუჭებულ დეტალს კამერას აჩვენებს და ერთად არკვევენ, როგორ გამოასწორონ.
რატომ არ არის Griffin ჯერ ხელმისაწვდომი
Tavus თავად აღიარებს, რომ იგივე თვისებები, რაც Griffin-ს ბუნებრივ მოსაუბრედ აქცევს, შესაძლებელს ხდის ადამიანის მოტყუებასაც – იმის დაჯერებას, რომ AI-სთან არ საუბრობს. კომპანიის თქმით, უსაფრთხო გამოშვებისთვის დამატებითი alignment და უსაფრთხოების პროცედურებია საჭირო.
ამ ეტაპზე Tavus მუშაობს ფუნქციებზე, რომლებიც მოსაუბრეს აცნობებს, რომ AI-სთან აქვს საქმე, და თანამშრომლობს AI უსაფრთხოებაზე მომუშავე ორგანიზაციებთან. Griffin-Lite მომხმარებლებისთვის ჯერ არ არის ხელმისაწვდომი, თუმცა სანდო ტესტერებს შეუძლიათ წვდომის მოთხოვნა სპეციალური ფორმით. Griffin-ის ფართო გამოშვებას კომპანია მას შემდეგ გეგმავს, რაც უსაფრთხოების საკითხებს მოაგვარებს.
ვინ იდგა პროექტის უკან
Griffin 2026 წლის 1 ოქტომბერს წარადგინეს Tavus-ის თანადამფუძნებელმა და აღმასრულებელმა დირექტორმა ჰასან რაზამ და კვლევების ხელმძღვანელმა იოანის პატრასმა. ინფრასტრუქტურაში კომპანიას დაეხმარნენ Baseten, Daily და Cerebrium, კვლევით პარტნიორად კი Queen Mary University of London დასახელდა.
სანამ Griffin პლატფორმაზე გამოჩნდება, Tavus-ის მომხმარებლები კვლავ Phoenix-ის, Raven-ისა და Sparrow-ის მოდელებით აწყობენ ციფრულ პერსონაჟებს. კომპანიის თქმით, ამ მოდელებს 150 000 დეველოპერი და კომპანია იყენებს.
AI მოდელები - სხვა სტატიები
Gemini 4 Argon – Google-ის ახალი მოდელი
AI-ის ნაცვლად SI: ტრამპი AI-ს სახელს უცვლის
Eleven v4: ElevenLabs-ის ახალი მეტყველების მოდელი
