კომპანია Anthropic-მა Claude Sonnet 5 წარადგინა – მათი აქამდე ყველაზე აგენტური Sonnet მოდელი. ის გეგმავს, იყენებს ისეთ ხელსაწყოებს, როგორიცაა ბრაუზერი და ტერმინალი, და ავტონომიურად მუშაობს იმ დონეზე, რომელიც სულ რამდენიმე თვის წინ უფრო დიდ და ძვირ მოდელებს სჭირდებოდათ.
მოდელი 30 ივნისს გამოვიდა და უკვე ხელმისაწვდომია ყველა პაკეტზე. Anthropic-ის თქმით, Sonnet 5 მნიშვნელოვანი წინსვლაა წინამორბედ Sonnet 4.6-თან შედარებით ისეთ მიმართულებებში, როგორიცაა მსჯელობა, ხელსაწყოების გამოყენება, კოდირება და ცოდნაზე დაფუძნებული სამუშაო.
სარჩევი
რა ხდის Claude Sonnet 5-ს აგენტურს
ბევრი დეველოპერისთვის აგენტური AI-ის ერა სწორედ Sonnet-კლასის მოდელებით დაიწყო. Claude Sonnet 3.5, 3.6 და 3.7 იყო პირველი მოდელები, რომლებმაც კოდირებასა და ხელსაწყოების გამოყენებაში შთამბეჭდავი უნარები აჩვენეს.
თუმცა ბოლო ხანს Claude-ის აგენტურ შესაძლებლობებში ყველაზე ნათელი წინსვლა Opus-კლასის მოდელებში ჩანდა. სწორედ ამ სხვაობას ამცირებს Sonnet 5 – მისი წარმადობა ახლოსაა Opus 4.8-თან, თუმცა გაცილებით დაბალ ფასად.
ადრეული ტესტერების მიხედვით, Sonnet 5 ბევრად უფრო აგენტურია, ვიდრე მისი წინამორბედები. ის ასრულებს რთულ ამოცანებს, სადაც წინა Sonnet მოდელები ჩერდებოდნენ, და დამატებითი მითითების გარეშე საკუთარ შედეგსაც ამოწმებს.
Sonnet 5 უახლოვდება Opus 4.8-ს
Anthropic-მა Sonnet 5-ის წარმადობა Sonnet 4.6-სა და Opus 4.8-ს შეადარა აგენტური ძიების შეფასებაზე (BrowseComp) და კომპიუტერის გამოყენების შეფასებაზე (OSWorld-Verified). შედეგების მიხედვით, Sonnet 5 ცალსახა გაუმჯობესებაა Sonnet 4.6-თან შედარებით.
მაღალი სიზუსტისთვის Opus 4.8 კვლავ რჩება საუკეთესო არჩევანად, თუმცა Sonnet 5 დეველოპერებს გაცილებით ხარისხიან და იაფ ვარიანტს სთავაზობს, ვიდრე აქამდე იყო ხელმისაწვდომი. მომხმარებლებს შეუძლიათ ძალისხმევის (effort) დონის რეგულირება, რომ ფასისა და წარმადობის სასურველი ბალანსი იპოვონ.
ფასები და ხელმისაწვდომობა
Claude Sonnet 5 ხელმისაწვდომია ყველგან. ის ნაგულისხმევი მოდელია Free და Pro გეგმებზე და ხელმისაწვდომია Max, Team და Enterprise მომხმარებლებისთვისაც.
დეველოპერებს მოდელის გამოყენება Claude Platform-სა და Claude Code-ში შეუძლიათ, API-ის სტრიქონით claude-sonnet-5. ფასი 31 აგვისტომდე შეადგენს $2-ს მილიონ შემავალ ტოკენზე და $10-ს მილიონ გამავალ ტოკენზე.
ამ თარიღის შემდეგ სტანდარტული ფასი იქნება $3 მილიონ შემავალ და $15 მილიონ გამავალ ტოკენზე. შედარებისთვის, Opus 4.8 ღირს $5 მილიონ შემავალ და $25 მილიონ გამავალ ტოკენზე.
Anthropic აღნიშნავს, რომ Sonnet 5 განახლებულ ტოკენიზატორს იყენებს, რის გამოც ერთი და იგივე ტექსტი მეტ ტოკენად შეიძლება დაიყოს. სარეკლამო ფასი სწორედ ისეა შერჩეული, რომ Sonnet 4.6-დან გადასვლა ხარჯის თვალსაზრისით დაახლოებით ნეიტრალური დარჩეს.
უსაფრთხოება და კიბერდაცვა
Anthropic-ის წინასწარი უსაფრთხოების შეფასებებმა აჩვენა, რომ Sonnet 5 საერთო ჯამში Sonnet 4.6-ზე უკეთესია. მოდელი უფრო კარგად ამბობს უარს მავნე მოთხოვნებზე და უძლებს prompt injection-ის თავდასხმებს.
Sonnet 5-ს ასევე აქვს ჰალუცინაციისა და მლიქვნელობის (sycophancy) უფრო დაბალი მაჩვენებელი, ვიდრე Sonnet 4.6-ს. ავტომატური ქცევითი აუდიტის მიხედვით, მოდელი საერთო ჯამში უფრო უსაფრთხოა, თუმცა აჩვენებს უფრო მაღალ მაჩვენებლებს, ვიდრე უფრო ძლიერი Opus 4.8 და Claude Mythos Preview.
კიბერუსაფრთხოების ამოცანებში Sonnet 5-ის შესაძლებლობები გაცილებით სუსტია, ვიდრე Opus მოდელების. Firefox ბრაუზერის სუსტი წერტილების ექსპლუატაციის ტესტში მან სრულად მუშა ექსპლოიტი ვერასდროს შექმნა, თუმცა ნაწილობრივი წარმატების ოდნავ მაღალი მაჩვენებელი აჩვენა, ვიდრე Sonnet 4.6-მა.
რადგან მოდელი წინამორბედზე ოდნავ ძლიერია, Anthropic-მა ის ნაგულისხმევად ჩართული კიბერდაცვით გამოუშვა. ეს დაცვა იგივეა, რაც Claude Opus 4.7-სა და 4.8-ში არსებობდა და რეალურ დროში აღმოაჩენს და ბლოკავს მავნე კიბერაქტივობას.
რას ამბობენ ადრეული პარტნიორები
ანთროფიკმა გამოაქვეყნა ადრეული წვდომის პარტნიორების გამოხმაურებები. ტესტერების შეფასებით, Sonnet 5 უკეთ ართმევს თავს მრავალსაფეხურიან პროგრამულ ამოცანებს და დროულად ასრულებს მათ.
ერთ-ერთმა მათგანმა მოდელს ხარვეზის გამოძიება დაავალა. Sonnet 5-მა მითითების გარეშე დაწერა ხარვეზის აღმწარმოებელი ტესტი, დანერგა შესწორება და შემდეგ ცვლილება დროებით გვერდზე გადადო, რათა დარწმუნებულიყო, რომ მის გარეშე ხარვეზი ბრუნდებოდა – ეს ყველაფერი ერთ გავლაში.
საერთო ჯამში, Claude Sonnet 5 Anthropic-ის მცდელობაა, აგენტური წარმადობა, რომელიც აქამდე მხოლოდ უფრო ძვირ მოდელებში იყო ხელმისაწვდომი, უფრო ფართო აუდიტორიას უფრო დაბალ ფასად მიაწოდოს.
სხვა თემები
Claude – Anthropic-ის AI ასისტენტი
OpenAI-მ AI უსაფრთხოების რისკების შეფასების გუნდი დაშალა
AI-სიახლეები: როგორ ვითარდება ინდუსტრია
