ElevenLabs-მა ორი ახალი ხმოვანი მოდელი წარადგინა – Eleven v4 და Eleven v4 Turbo. კომპანია მათ თავის ყველაზე სწრაფ და ემოციურ მოდელებს უწოდებს. ეს მხოლოდ მარკეტინგული განცხადება არ არის: დამოუკიდებელი შეფასების პლატფორმამ Artificial Analysis-მა Eleven v4 თავისი text-to-speech რეიტინგის პირველი ადგილი მიანიჭა.
ხელოვნური ინტელექტით შექმნილი ხმა დღეს ბევრგან გვხვდება – აუდიოწიგნებსა და პოდკასტებში, სარეკლამო რგოლებში, ვიდეოების გახმოვანებასა და მომხმარებელთა მომსახურების ზარებში. ასეთ მოდელებს ყოველთვის ორი მთავარი მოთხოვნა ჰქონდათ: ხმა ბუნებრივად უნდა ჟღერდეს და პასუხი დაუყოვნებლივ უნდა მოდიოდეს. ElevenLabs-ის ახალი თაობა ამ ორ ამოცანას ცალ-ცალკე მოდელით პასუხობს.
სარჩევი
ორ მოდელს განსხვავებული დანიშნულება აქვს. Eleven v4 გათვლილია აუდიოწიგნებზე, გახმოვანებაზე, დიალოგებსა და პერსონაჟებზე, ხოლო Turbo ვერსია – რეალურ დროში მიმდინარე საუბრებსა და ხმოვან აგენტებზე.
რა არის ახალი Eleven v4-ში
Eleven v4 სრულიად ახალ არქიტექტურაზეა აგებული. ElevenLabs-ის თქმით, მოდელი სცენარს ისე კითხულობს, როგორც მსახიობი: ესმის, ვინ ლაპარაკობს, რა მოხდა წინა ფრაზაში და როგორ უნდა გაჟღერდეს შემდეგი.
მოდელი 90-ზე მეტ ენაზე მუშაობს. წინა თაობის Eleven v3 70-ზე მეტ ენას უჭერდა მხარს.
რეჟისორული მითითებები პირდაპირ ტექსტში
ტექსტში შეგიძლიათ ჩასვათ ისეთი ტეგები, როგორიცაა [laughs], [whispers] ან [door slams], და მოდელი სიცილს, ჩურჩულს ან კარის მიჯახუნებას თავად დაამატებს. კომპანიის თქმით, Eleven v4 ტეგების თანმიმდევრობას v3-ზე საიმედოდ მიჰყვება, მათ შორის ხმოვან ეფექტებსაც. ერთ ჩანაწერში რამდენიმე მოლაპარაკის გამოყენებაც შეიძლება.
გრძელი ტექსტი ერთ ტემპში
ე.წ. context stitching ფუნქცია ნებისმიერი სიგრძის სცენარში ინარჩუნებს ტემპსა და ინტონაციას. იდეა ისაა, რომ მთელი აუდიოწიგნი პირველიდან ბოლო გვერდამდე ერთ ჩაწერად ჟღერდეს და არა ცალკეულ ნაწყვეტებად.
ამას ემატება ხმის სტაბილურობა: ერთი და იგივე ფრაზა ერთხელაც რომ დააგენერიროთ და ორმოცდაათჯერაც, ხმა იგივე ადამიანისად უნდა დარჩეს.
Professional Voice Clone-ის დაბრუნება
Eleven v3-ში Professional Voice Clone-ები მხარდაჭერილი არ იყო. Eleven v4-ში ისინი დაბრუნდა და მოდელის სრულ ემოციურ დიაპაზონს იყენებს ყველა ენაზე, რომელზეც კლონი მუშაობს.
გარდა ამისა, ხმის დაკლონვა ათწამიანი ჩანაწერიდანაც შეიძლება, Voice Design ხმას მოკლე ტექსტური აღწერით ქმნის, ხოლო Pronunciation Dictionary საშუალებას იძლევა, IPA-ს დახმარებით სახელების, აბრევიატურებისა და ტექნიკური ტერმინების გამოთქმა წინასწარ განსაზღვროთ.
Eleven v4 Artificial Analysis-ის რეიტინგში
Artificial Analysis-ის Provider Voice Arena-ში მოდელებს მსმენელები ბრმა შედარებით აფასებენ – ისმენენ ერთი და იგივე ტექსტის ორ ვერსიას და ირჩევენ უფრო ბუნებრივს. ამ რეიტინგში Eleven v4 პირველია 1,319 Elo ქულით. მეორე ადგილზეა Cartesia-ს Sonic 3.6 (1,276), მესამეზე კი Google-ის Gemini 3.8 Flash TTS (1,267).
Artificial Analysis-ის მონაცემებით, Eleven v4 ოთხივე კატეგორიაში პირველია: მომხმარებელთა მომსახურება, ასისტენტები, ცოდნის გაზიარება და გართობა.
- Pronunciation Robustness: 91.7% – ყველაზე მაღალი შედეგი, რაც Artificial Analysis-ს ამ ტესტში ოდესმე გაუზომავს. Eleven v3-ს 85.6% ჰქონდა.
- Controlled Voice: მეორე ადგილი 1,157 ქულით, ალიბაბას Qwen-Audio-3.1-TTS-Plus-ის (1,178) შემდეგ. აქ ყველა მოდელი ერთსა და იმავე ხმას იყენებს, ამიტომ შედარება უფრო სუფთაა.
- სიჩქარე: 73.4 სიმბოლო წამში, Eleven v3-ის 42.5-ის ნაცვლად.
ხარისხს თავისი ფასი აქვს. Artificial Analysis-ის მიხედვით, Eleven v4 მილიონ სიმბოლოზე 80 დოლარი ღირს, Sonic 3.6 – 49 დოლარი, Gemini 3.8 Flash TTS კი – 16.49 დოლარი. ანუ ლიდერი ამ შემთხვევაში ყველაზე ძვირიცაა.
Eleven v4 Turbo – რეალური დროისა და აგენტებისთვის
Eleven v4 Turbo კომპანიის ყველაზე სწრაფი მოდელია რეალური დროის მეტყველებისთვის. მისი მედიანური დაყოვნება დაახლოებით 150 მილიწამია და ElevenLabs-ის თქმით, გრძელ საუბრებშიც სტაბილური რჩება. ამავდროულად, Turbo ინარჩუნებს Eleven v4-ის ემოციურ დიაპაზონს.
ElevenLabs-ის საკუთარ შედარებაში პირველი ხმის გაჟღერებამდე მედიანური დრო Sonic 3.6-თან 262 მს-ია, OpenAI-ს GPT-4o mini TTS-თან კი 814 მს. ეს კომპანიის მიერ გამოქვეყნებული ციფრებია და არა დამოუკიდებელი გაზომვა.
რატომ არის ეს მნიშვნელოვანი ხმოვანი აგენტებისთვის
- ორმხრივი სტრიმინგი: ტექსტი მოდელს შეიძლება მიეწოდოს იმავდროულად, როცა LLM მას აგენერირებს, და აუდიო წინადადების დასრულებამდე იწყებს დაბრუნებას.
- ინტონაციური განსხვავება: დადასტურება, ესკალაცია თუ ლოდინის თხოვნა ერთნაირი ტონით არ ჟღერს.
- ერთი ბრენდული ხმა: Professional Voice Clone-ები ორივე მოდელზე ერთნაირად მუშაობს, ამიტომ ზარის დასაწყისიდან ბოლომდე ხმა არ იცვლება.
ახალ მოდელს უკვე იყენებს Salesforce თავის Agentforce Voice-ში. კომპანიის პროდუქტის ხელმძღვანელი აღნიშნავს, რომ Eleven v4 Turbo უფრო სწრაფ და ბუნებრივ პასუხებს იძლევა. გაშვებაზე გამოხმაურებები გამოაქვეყნეს BeyondWords-მა და Accenture-ის წარმომადგენელმაც.
ხელმისაწვდომობა და ფასები
Eleven v4 და Eleven v4 Turbo უკვე ხელმისაწვდომია ElevenCreative-ში, ElevenAgents-სა და ElevenAPI-ში. Turbo ვერსია API-სა და ElevenAgents-ის მეშვეობით გამოიყენება.
- უფასო გეგმა: თვეში 10,000 კრედიტი პირადი გამოყენებისთვის, საკრედიტო ბარათის გარეშე.
- ფასიანი გეგმები: თვეში 6 დოლარიდან, 30,000-ზე მეტი კრედიტით და Professional Voice Clone-ით.
- Enterprise: ინდივიდუალური ფასი, მეტი მოცულობა და პრიორიტეტული მხარდაჭერა.
დეველოპერებისთვის მოდელებზე წვდომა REST API-ით, სტრიმინგის ენდპოინტებით და TypeScript-ისა და Python-ის SDK-ებით არის შესაძლებელი. მოდელებს შორის გადართვა ერთი model_id-ის შეცვლით ხდება, ხოლო Eleven v4-ის იდენტიფიკატორია eleven_v4. დეტალები ElevenLabs-ის დოკუმენტაციაშია.
სხვა თემები
ElevenMusic: პლატფორმა მუსიკის შესაქმნელად
ხელოვნური ინტელექტის უახლესი ინსტრუმენტები
ElevenLabs Marketplace კრეატორებისთვის
