Claude Opus 5 უკვე ხელმისაწვდომია. Anthropic-მა ახალი მოდელი წარადგინა და მას “მოაზროვნე და პროაქტიულ” მოდელს უწოდებს, რომელიც Fable 5-ს უახლოვდება ინტელექტით, თუმცა ორჯერ იაფია. Claude Opus 5 ხელმისაწვდომია ყველა პლატფორმაზე, როგორც ვებსაიტზე, ისე აპლიკაციაში.
ეს არის Opus ხაზის განახლება, რომელიც პირდაპირ ცვლის Opus 4.8-ს. Anthropic-ის თქმით, კოდირებისა და ცოდნაზე დაფუძნებული სამუშაოს შეფასებებზე, როგორიცაა Frontier-Bench და GDPval-AA, ახალი მოდელი საუკეთესო შედეგს აჩვენებს ბაზარზე არსებულ მოდელებს შორის. ერთი გამონაკლისით: კიბერუსაფრთხოების ამოცანებზე ის Mythos 5-ს ჩამორჩება.
სარჩევი
რით სჯობს Claude Opus 5 წინამორბედ Opus 4.8-ს
მთავარი განსხვავება ისაა, რომ Opus 5 იმავე ფასად უფრო მეტს აკეთებს. Anthropic-ის ცნობით, მოდელი მნიშვნელოვნად უკეთეს შედეგს იძლევა ზუსტად იმ ღირებულებით, რაც Opus 4.8 ღირდა.
ტექნიკურ დონეზე მოდელს აქვს “effort” პარამეტრი, რომლითაც მომხმარებელი ირჩევს, უფრო ღრმა მსჯელობა უნდა თუ ტოკენების ეკონომია და სისწრაფე. სწორედ ამ პარამეტრის სხვადასხვა დონეზეა გაზომილი კომპანიის გამოქვეყნებული შედეგები.
კონკრეტული მაგალითი: Frontier-Bench v0.1-ზე Opus 5 ყველა სხვა მოდელს უსწრებს და Opus 4.8-ის შედეგს ორჯერ მეტად აჭარბებს, ამასთან ერთ ამოცანაზე ნაკლები დანახარჯით. CursorBench 3.2-ზე მაქსიმალურ effort-ზე ის Fable 5-ის საუკეთესო ქულას 0.5%-ზე ნაკლები სხვაობით უახლოვდება, ამოცანაზე ორჯერ ნაკლები ღირებულებით.
ბენჩმარკები: სად ჩანს ყველაზე დიდი ნახტომი
Anthropic-მა რამდენიმე დამოუკიდებელ და პარტნიორულ შეფასებაზე გამოაქვეყნა შედეგები. ყველაზე თვალშისაცემი ციფრები ასე გამოიყურება:
- ARC-AGI 3 – ახალი, უცნობი ამოცანების ამოხსნაზე Opus 5-ის ქულა სამჯერ აღემატება მეორე საუკეთესო მოდელისას.
- Zapier AutomationBench – ბიზნეს ამოცანების ბოლომდე შესრულებაში მოდელის გავლის მაჩვენებელი დაახლოებით 1.5-ჯერ მეტია მომდევნო საუკეთესო მოდელზე, იმავე ღირებულებით. მინიმალურ effort-ზეც კი ის სხვა ყველა მოდელზე მეტ ამოცანას ასრულებს.
- OSWorld 2.0 – კომპიუტერის გამოყენების ტესტში Opus 5 Fable 5-ის საუკეთესო შედეგს აჭარბებს დანახარჯის მხოლოდ ერთ მესამედზე ოდნავ მეტით.
ასევე აღსანიშნავია რომ მოდელი Anthropic-ის ბიოსამეცნიერო შეფასებების ყველა კატეგორიაში სჯობს Opus 4.8-ს. ორგანულ ქიმიაში, მაგალითად სპექტროსკოპიის მონაცემებიდან მოლეკულური სტრუქტურის დადგენაში, კომპანიის შიდა ბენჩმარკზე შედეგი 10.2 პროცენტული პუნქტით მაღალია, ცილებთან დაკავშირებულ ამოცანებზე კი 7.7 პროცენტული პუნქტით.

რას ამბობენ ადრეული წვდომის მომხმარებლები
Cursor-ის თანადამფუძნებელი სუალეჰ ასიფის შეფასებით, მოდელი Fable 5-თან ახლო ინტელექტს იძლევა Opus-ის სიჩქარესა და ღირებულებაზე. Zapier-ის CEO ვეიდ ფოსტერის თქმით, Opus 5-მა კომპანიის AutomationBench-ის ლიდერბორდი დაიკავა ისე, რომ წინა Claude მოდელებზე მეტი ტოკენი არ დახარჯა.
Box-ის CTO ბენ კუსი აღნიშნავს, რომ Opus 5 Opus 4.8-ს 8%-ით უსწრებს, მონაცემთა ანალიზში 11%-იან, ხოლო due diligence-ის სამუშაო პროცესებში 17%-იან გაუმჯობესებას იძლევა.
Alignment და უსაფრთხოება
Anthropic-ის განცხადებით, გამოშვებამდე ჩატარებულმა ავტომატურმა ქცევითმა აუდიტმა Opus 5 კომპანიის ისტორიაში ყველაზე კარგად მორგებულ (aligned) მოდელად შეაფასა. ის უკეთ მისდევს Claude-ის კონსტიტუციას, ვიდრე Opus 4.8, Sonnet 5 ან Fable 5, და ყველაზე დაბალი მაჩვენებელი აქვს მატყუარა ქცევაზე.
საშიში, ორმაგი დანიშნულების შესაძლებლობების მხრივ მოდელი წინ არ იწევს. კომპანია პირდაპირ წერს, რომ ის Mythos 5-ს ჩამორჩება როგორც ბიოლოგიის კვლევაში, ისე შეტევით კიბერუსაფრთხოებაში.
Opus 4.8-ის მსგავსად, Opus 5 განზრახ არ არის გაწვრთნილი კიბერამოცანებზე. მიუხედავად ამისა, ზოგადი უნარების ზრდის კვალდაკვალ ის ამ მიმართულებითაც გაძლიერდა: სისუსტეების პოვნაში Mythos 5-ს უახლოვდება, თუმცა მათი ექსპლუატაციისთვის კოდის შექმნაში მნიშვნელოვნად ჩამორჩება. ეს OSS-Fuzz-ის შედეგებში ჩანს. დეტალები სისტემურ ბარათშია.
როგორ მუშაობს დაცვის მექანიზმები
Opus 5-ის კიბერკლასიფიკატორები Fable 5-ისაზე ნაკლებად მკაცრია. ისინი უშვებენ სისუსტეების ძებნას საწყის კოდში, მაგრამ ბლოკავენ ბინარულ სკანირებას, penetration testing-სა და ექსპლოიტების გენერაციას.
Anthropic-ის შეფასებით, კლასიფიკატორები დაახლოებით 85%-ით ნაკლებად ჩაერევა, ვიდრე Fable 5-ის შემთხვევაში. Claude.ai-ზე, Claude Code-სა და Claude Cowork-ში მონიშნული მოთხოვნები ავტომატურად Opus 4.8-ზე გადადის. ბიოლოგიასთან დაკავშირებული მოთხოვნები, რომლებიც Fable 5-ზე იბლოკება, ახლა Opus 5-ს გადაეცემა და არა Opus 4.8-ს.
ფასი, სიჩქარე და ხელმისაწვდომობა
Claude Opus 5 ღირს $5 მილიონ შემავალ ტოკენზე და $25 მილიონ გამომავალ ტოკენზე – ზუსტად იმდენი, რამდენიც Opus 4.8 ღირდა. დეველოპერებისთვის მოდელის იდენტიფიკატორია claude-opus-5 Claude API-ზე.
ის ასევე ხელმისაწვდომია Fast რეჟიმში, სადაც დაახლოებით 2.5-ჯერ უფრო სწრაფად მუშაობს. Fast რეჟიმი ბაზისურ ფასზე ორჯერ ძვირია Claude Platform-ზე, Claude Code-ში კი usage credits-ით მუშაობს.
მომხმარებლებისთვის Opus 5 გახდა ნაგულისხმევი მოდელი Claude Max-ზე და ყველაზე ძლიერი მოდელი Claude Pro-ზე.
გამოშვებას ორი beta სიახლეც ახლავს: საუბრის მიმდინარეობისას ხელსაწყოების შეცვლა prompt cache-ის გაუქმების გარეშე, და ავტომატური fallback-ები API-ზე, რაც უსაფრთხოების კლასიფიკატორის მიერ მონიშნულ მოთხოვნებს ბლოკირების ნაცვლად სხვა მოდელზე გადაამისამართებს.
საერთო სურათი ასეთია: კოდირებისა და ცოდნის სამუშაოს შეფასებებზე Claude Opus 5 პირველ ადგილზეა, კიბერუსაფრთხოებასა და ბიოლოგიის კვლევაში კი Mythos 5 რჩება უფრო ძლიერი. მისი ლოგიკა ყოველდღიური სამუშაოა, სადაც ფასისა და შედეგის თანაფარდობა უფრო მნიშვნელოვანია, ვიდრე რამდენიმე პროცენტი ბენჩმარკზე.
სხვა თემები
კოლექტიური კიბერთავდაცვა: OpenAI-ის ღია წერილი
GlucoFM – Google-ის ახალი AI მოდელი
NVIDIA AVO-მ ARC-AGI-3-ის საჯარო ტესტზე 100% შედეგი აჩვენა
