AGI HAS ARRIVED
28 სექტემბერი, 2026

Anthropic-მა Claude Sonnet 5.5 წარადგინა

Claude Sonnet 5.5

Anthropic-მა Claude Sonnet 5.5 წარადგინა – Claude 5.5 ოჯახის მეორე მოდელი. კომპანიის განცხადებით, ის Sonnet 5-ზე აშკარად ძლიერია, პასუხებს 30%-ზე მეტად სწრაფად აგენერირებს და სამუშაოს უმეტეს ნაწილზე 30%-მდე ნაკლები უჯდება.

ეს Anthropic-ის ყველაზე სწრაფი Sonnet მოდელია. ამასთან, ტოკენის ფასი არ შეცვლილა – დანაზოგი იქიდან მოდის, რომ მოდელს იმავე ამოცანისთვის გაცილებით ნაკლები ტოკენი სჭირდება.

სარჩევი

გადმოწერე Claude

Sonnet 5.5 და Opus 5.5 – ორი ახალი მოდელი

Sonnet 5.5 Claude Opus 5.5-ის უფრო სწრაფი და იაფი დანამატია. Opus 5.5 რთული სამუშაოსთვისაა, სადაც ფრთხილი განსჯაა საჭირო, Sonnet 5.5 კი საუკეთესოდ მკაფიოდ განსაზღვრულ ყოველდღიურ ამოცანებს, ბაგების გასწორებას და დოკუმენტების, სლაიდებისა და ცხრილების შექმნას ართმევს თავს.

Anthropic აღნიშნავს, რომ მოდელს დიზაინის კარგი ალღოც აქვს. ოჯახის მესამე წევრი, Claude Haiku 5.5, რომელიც დიდი მოცულობისა და დაბალბიუჯეტიანი გამოყენებისთვისაა გათვლილი, უახლოეს კვირებში დაემატება.

Claude Sonnet 5.5-ის შედეგები ბენჩმარკებზე

ზოგ ტესტში ნახტომი მართლაც დიდია. აგენტური კოდირების ტესტ Terminal-Bench 4.0-ზე Claude Sonnet 5.5-მა 70.6% აიღო, Sonnet 5-ის 10.3%-ის ნაცვლად. რამდენიმე შეფასებაში მაქსიმალური ძალისხმევის (effort) დონეზე მოდელი Opus 5.5-ის შედეგებს უახლოვდება.

  • CursorBench 4.0 – 55.5% (Sonnet 5: 34.1%, Opus 5.5: 57.8%)
  • FrontierCode 1.1 – 52.1% Xhigh დონეზე (Sonnet 5: 42.4%, Opus 5.5: 54.4%)
  • GDPval-AA v2.1 – 1844 ქულა (Sonnet 5: 1449, Opus 5.5: 1846)
  • AA-Briefcase v1.1 – 1811 ქულა (Sonnet 5: 1359, Opus 5.5: 1822)
  • Humanity’s Last Exam ხელსაწყოებით – 64.5% (Sonnet 5: 54.9%)
  • OSWorld 2.1 – 80.1% (Sonnet 5: 57.0%, Opus 5.5: 81.8%)
  • Chartography – 61.6% (Sonnet 5: 15.6%)

კიდევ ერთი საინტერესო დეტალი: ეს პირველი Sonnet მოდელია, რომელმაც Pokémon Red მხოლოდ სკრინშოტებზე დაყრდნობით გაიარა.

თავად Anthropic აზუსტებს, რომ ბენჩმარკები მოდელის შესაძლებლობების მხოლოდ ერთ მხარეს აჩვენებს. კომპანიის და გარე ტესტერების შეფასებით, რთულ, ღია ამოცანებში, სადაც ხანგრძლივი განსჯაა საჭირო, Opus 5.5 კვლავ აშკარად ძლიერია.

sonnet 5 5 benchmarks

კოდირება – სადაც ცვლილება ყველაზე მეტად ჩანს

FrontierCode-ზე High დონეზე Sonnet 5.5 იმავე პარამეტრებით Sonnet 5-ს 10 ქულით უსწრებს, ამოცანაზე დაახლოებით თხუთმეტჯერ ნაკლებ ხარჯად. CursorBench-ზე, რომელიც Cursor-ის რეალური სესიებიდან აღებულ ამოცანებს იყენებს, მისი საუკეთესო შედეგი Opus 5.5-ს დაახლოებით ორი ქულით ჩამორჩება.

ადრეულმა ტესტერებმა აღნიშნეს, რომ მოდელი კოდის ბაზაში სწრაფად ერკვევა და ხელსაწყოების გამოძახებებს უფრო ხშირად აჯგუფებს, რაც ნაკლებ ნაბიჯსა და ნაკლებ ხარჯს ნიშნავს.

  • Base44-ის 118 რეალურ აპლიკაციაზე მოდელმა Opus 5-ის დონის შედეგი აჩვენა – საშუალოდ 3.6 იტერაციაში, მაშინ როცა Opus 5-ს 7.7 დასჭირდა.
  • Unity-ის მრავალეტაპიან ბენჩმარკში მოდელმა ამოცანების 90% შეასრულა.
  • Epic Games-ის ტესტებში Sonnet 5.5-მა ათიათასობით სტრიქონიანი კოდი და მრავალსაათიანი ამოცანები ნაკლები დეტალური მითითებით მართა.

ოფისური და ანალიტიკური სამუშაო

GDPval-AA ტესტი მოდელებს 44 პროფესიისა და ცხრა დიდი ინდუსტრიის რეალურ ამოცანებზე ამოწმებს. აქ Claude Sonnet 5.5 თითქმის Opus 5.5-ის დონეზეა და Sonnet 5-ს დაახლოებით 400 ქულით უსწრებს.

ერთ შიდა ტესტში მოდელს საჯარო კომპანიის კვარტალური ანგარიშები, კონფერენც-ზარების ტრანსკრიპტები და სლაიდების შაბლონი მისცეს და 10-სლაიდიანი მიმოხილვის მომზადება სთხოვეს. ორმა ექსპერტმა პირველი ვერსია პირდაპირ გასაგზავნად მზად მიიჩნია.

კომპანიების შეფასებებიც მსგავს სურათს ხატავს:

  • Zendesk-ში მხარდაჭერის ტიკეტები 20%-ით სწრაფად დამუშავდა.
  • Box-ის მონაცემებით, მოდელი წინამორბედზე 2.4-ჯერ სწრაფი იყო და 12%-ით ნაკლები ტოკენი გამოიყენა.
  • Balyasny Asset Management-ის 2,441 ფინანსურ ამოცანაზე Sonnet 5.5-მა პასუხზე დაახლოებით 121 ათასი ტოკენი დახარჯა, Sonnet 5-მა კი 497 ათასი.
  • Slack-ის შეფასებებში მოდელმა თითქმის ყველა ტესტში უკეთ იმუშავა, დაახლოებით 14%-ით ნაკლები გამომავალი ტოკენით.
  • Atlassian-ის თქმით, Rovo Agents-ის მუშაობა 30%-მდე დაჩქარდება.

Claude Sonnet 5.5-ის ფასი

ტარიფი Sonnet 5-ის იდენტურია:

  • შემავალი ტოკენები – $2 მილიონზე
  • გამომავალი ტოკენები – $10 მილიონზე
  • ქეშის წაკითხვა – $0.20 მილიონზე
  • ქეშის ჩაწერა – $2.50 მილიონზე

შედარებისთვის, Opus 5.5-ის ფასია $4 შემავალ და $20 გამომავალ მილიონ ტოკენზე. Anthropic-ის მონაცემებით, რამდენიმე ბენჩმარკზე Sonnet 5.5 Low ან Medium დონეზე Sonnet 5-ის საუკეთესო შედეგს ჯობნის, ამოცანაზე დაახლოებით ათჯერ ნაკლებ ხარჯად.

ძალისხმევის დონეები

ძალისხმევის დონე ხარჯს, სიჩქარესა და ხარისხს შორის ბალანსს არეგულირებს. Claude Code-სა და Claude-ის აპლიკაციებში ნაგულისხმევად Medium დგას, Claude Platform-ზე კი High. დაბალ დონეზე მოდელი უფრო სწრაფად პასუხობს, მაღალზე უფრო დიდხანს ფიქრობს და ნამუშევარს საფუძვლიანად ამოწმებს.

უსაფრთხოება

ავტომატიზებულ ქცევით აუდიტში, რომელიც დაახლოებით 1,850 სცენარს მოიცავს, Sonnet 5.5 ალაინმენტის უმეტეს საზომზე Sonnet 5-ს უტოლდება ან აჯობებს. Anthropic-ს ვერ უპოვია ნიშანი იმისა, რომ მოდელი მომხმარებლის განზრახვის საწინააღმდეგო მიზნებს მისდევს, თუმცა კომპანია აღიარებს, რომ არცერთი შეფასება ყველა პრობლემას ვერ იჭერს.

რადგან მოდელის კიბერუსაფრთხოების შესაძლებლობები Opus 5-ის დონეს უახლოვდება, ეს პირველი Sonnet-ია, რომელიც შესაბამისი დამცავი მექანიზმებით გამოვიდა. რუტინულ დეველოპმენტზე ეს გავლენას არ ახდენს, მაგრამ მაღალი რისკის კიბერამოცანები ავტომატურად Sonnet 5-ზე გადავა. ბიოლოგიის სფეროში დამცავი მექანიზმები Sonnet 5-ისას ემთხვევა.

გარდა ამისა, Sonnet 5.5 პირველი Sonnet მოდელია, რომელსაც დისტილაციის შეტევებისგან დამცავი კლასიფიკატორები აქვს – ესენი ხელს უშლის მოდელის მსჯელობის მასობრივ ამოღებას ყალბი ანგარიშებით.

სად არის ხელმისაწვდომი

Claude Sonnet 5.5 უკვე ყველა პლატფორმაზეა, მათ შორის Amazon Web Services-ზე, Google Cloud-სა და Microsoft Azure-ზე. დეველოპერებს Claude Platform-ზე მოდელი claude-sonnet-5-5 იდენტიფიკატორით შეუძლიათ გამოიყენონ, ხელმისაწვდომია მონაცემების ნულოვანი შენახვის (zero data retention) რეჟიმიც.

ვინც Sonnet-ს გამორთული thinking-ით იყენებს, გადასვლამდე ახალ between_tools პარამეტრზე უნდა გადაერთოს. დეტალები Anthropic-ის მიგრაციის გზამკვლევშია, ტესტირების სრული მეთოდოლოგია კი Sonnet 5.5-ის System Card-ში.

AI გზამკვლევი რა არის ხელოვნური ინტელექტი? სრული გზამკვლევი: როგორ მუშაობს AI, რა არის LLM და რას ნიშნავს AGI - მარტივ ქართულში.

LLM.GE - გზამკვლევი ხელოვნურ ინტელექტში

LLM.GE არის ქართულ-ენოვანი პლატფორმა, რომელზეც ყოველდღიურად ქვეყნდება AI და ტექნოლოგიების სიახლეები, ახალი მოდელების, კვლევებისა და პრაქტიკული ინსტრუმენტების შესახებ. საიტის მიზანია, მკითხველმა ერთ სივრცეში მიიღოს ზუსტი, გასაგები და დროული ინფორმაცია ტექნოლოგიური ინდუსტრიის მთავარი მოვლენების შესახებ

გამოიწერე სიახლეები

გამოწერის გაუქმება ნებისმიერ დროს შეგიძლიათ Privacy Policy

×