AGI HAS ARRIVED
11 ოქტომბერი, 2026

Microsoft-Decision-1: სწრაფი გადაწყვეტილებებისთვის

Microsoft Decision 1

კომპანია Microsoft-მა Microsoft-Decision-1 წარადგინა. ეს ახალი მოდელი ტექსტის დასაწერად ან რთული ამოცანების გადასაჭრელად არ არის შექმნილი. მისი საქმე სწრაფი და სტრუქტურირებული გადაწყვეტილების მიღებაა: მოთხოვნის დაკლასიფიცირება, სწორი მარშრუტის შერჩევა, პრიორიტეტის მინიჭება ან იმის შეფასება, ღირს თუ არა აგენტისთვის შემდეგი ნაბიჯის გადადგმა.

რა არის Microsoft-Decision-1 და რით განსხვავდება LLM-ისგან

Microsoft გადაწყვეტილების მოდელებს ხელოვნური ინტელექტის ახალ და მზარდ კატეგორიად მიიჩნევს. დიდი ენობრივი მოდელები ტექსტის გენერაციისა და მსჯელობისთვისაა შექმნილი, გადაწყვეტილების მოდელი კი ისეთ სტრუქტურირებულ პასუხს აბრუნებს, რომელზეც პროგრამას მაშინვე შეუძლია მოქმედება.

სარჩევი

პრაქტიკაში ეს ასე გამოიყურება: მოდელს აძლევთ პასუხის ფიქსირებულ ვარიანტებს, ის კი თითოეულ მათგანს კალიბრებულ ალბათობას ანიჭებს. მხარდაჭერილია დიახ/არა ტიპის კითხვები, რამდენიმე ვარიანტიდან არჩევა, რეიტინგი და AI-ის პასუხებისა თუ აგენტის ქმედებების რუბრიკით შეფასება. ყველაფერი ერთი მარტივი სტრუქტურირებული API გამოძახებით ხდება.

რაზეა აგებული

Microsoft-Decision-1 ღია მოდელის, Qwen3.5-9B-ის დამატებითი გაწვრთნით შეიქმნა და ერთ გავლაში სწრაფ შეფასებაზეა მორგებული. კომპანია წერს, რომ მოდელს მალე სხვა ბაზურ მოდელებზეც გადაიტანს, მათ შორის Microsoft AI-ის (MAI) და OpenAI-ის მოდელებზე.

სიჩქარე და სიზუსტე: რას აჩვენებს Microsoft-ის ტესტირება

Microsoft-ის მონაცემებით, მოდელმა საუკეთესო სიზუსტე აჩვენა 36 ბენჩმარკზე ჩატარებულ შედარებაში, რომელიც თითქმის 150 000 კითხვას მოიცავდა. ეს ბენჩმარკები წვრთნის პროცესისგან დამალული იყო, ანუ მოდელს ისინი წინასწარ არ უნახავს.

სიჩქარის მხრივ, Microsoft-Decision-1 გაზომილ მოდელებს შორის ყველაზე სწრაფი აღმოჩნდა. ის 2,5-ჯერ უსწრებს მეორე ადგილზე გასულ H2O-Lightning-4B v1.1-ს, რომელსაც H2O.ai ავითარებს, და დაახლოებით 35-ჯერ უსწრებს GPT-6 Sol-ს.

მნიშვნელოვანია ერთი დეტალი: ყველა ეს შედეგი Microsoft-ის საკუთარ შეფასებას ეყრდნობა. დამოუკიდებელი ტესტები ჯერჯერობით ცოტაა, ამიტომ რეალურ სამუშაო პირობებში მოდელის შესაძლებლობები დეველოპერების გამოცდილებით უფრო ნათლად გამოჩნდება.

ვისთან შეადარეს

შედარებაში მონაწილეობდნენ როგორც სხვა გადაწყვეტილების მოდელები, ისე LLM-ები. Microsoft-მა რამდენიმე წამყვანი მოდელი ღია ლიდერბორდ JevBench-იდანაც აიღო და დამატებით 36 საჯარო და კერძო ბენჩმარკზე გამოსცადა. ჩამონათვალში იყო:

  • Quyet-1.0-Large
  • Surogate Rune 26B-A4B
  • GPT-6 Luna Decisions
  • deck-31B
  • H2O-Lightning-4B
  • Strands-Decider 2B

ხუთი გამოწვევა, რომელიც Microsoft-ს უნდა გადაეჭრა

კომპანია ხსნის, რომ საიმედო გადაწყვეტილების მოდელის შესაქმნელად რამდენიმე პრობლემის გადალახვა იყო საჭირო.

სიჩქარე

ყოველი გადაწყვეტილება დაყოვნებას ამატებს, განსაკუთრებით მაშინ, როცა ერთი ნაბიჯი წინაზეა დამოკიდებული. Microsoft მარტივ მაგალითს მოიყვანს: თუ 20 თანმიმდევრული გადაწყვეტილებიდან თითოეულს 100 მილიწამი დაემატება, მთლიანი პროცესი ორი წამით შენელდება.

ხარისხი, რომელიც სხვა ამოცანებზეც მუშაობს

მოდელის ერთ კონკრეტულ ბენჩმარკზე „მორგება” ადვილია. ამიტომ Microsoft-Decision-1 ათობით დამალულ ბენჩმარკზე შეამოწმეს, რომლებიც მარშრუტიზაციას, რანჟირებას, გრძელ კონტექსტს, მრავალენოვან და უცნობ ამოცანებს, მსჯელობასა და უსაფრთხოებას მოიცავდა.

მდგრადობა

ერთი და იგივე შინაარსის მოთხოვნამ ერთი და იგივე გადაწყვეტილება უნდა გამოიწვიოს, მაშინაც კი, თუ ინსტრუქცია სხვა სიტყვებით არის ჩამოყალიბებული ან ვარიანტები სხვა თანმიმდევრობითაა. Microsoft ერთსა და იმავე მოთხოვნას რვანაირად ცვლის და ზომავს, რამდენად ხშირად იცვლება შედეგი.

საშუალოდ, მოდელი გადაწყვეტილებას ცვლილებების 1,3%-ში ცვლის. ვარიანტების აღწერის პერიფრაზირებისას ან მათი შებრუნება-არევისას კი გადაწყვეტილება საერთოდ არ შეცვლილა.

ალბათობის კალიბრაცია

აქ ალბათობა უბრალო რანჟირების ქულა არ არის, ის API-ის ნაწილია. აპლიკაციები სწორედ ამ რიცხვზე დაყრდნობით წყვეტენ, იმოქმედონ, გადადონ თუ ადამიანს გადასცენ შესამოწმებლად. ამიტომ 90%-იანი პროგნოზი დაახლოებით ათიდან ცხრა შემთხვევაში უნდა მართლდებოდეს.

უსაფრთხოება

მოდელმა საზიანო მოთხოვნები უნდა ამოიცნოს, მაგრამ უწყინარი შეკითხვები ზედმეტად არ დაბლოკოს. Microsoft-მა ის 11 ბენჩმარკის 5 250 მოთხოვნაზე შეამოწმა, რომლებიც საზიანო კონტენტს, jailbreak მცდელობებსა და prompt injection-ს მოიცავდა. კომპანიის თქმით, მოდელი საზიანო ქცევაზე უარს ამბობდა და ამავე დროს სარგებლიანობას ინარჩუნებდა.

როგორ იყენებს Microsoft მოდელს შიდა გუნდებში

გამოქვეყნებამდე Microsoft-Decision-1 კომპანიის რამდენიმე გუნდმა გამოსცადა. შედეგები Microsoft-ის მიერვეა წარმოდგენილი, თუმცა კონკრეტულ სამუშაო სცენარებს ეხება.

  • მონაცემების მარკირება: Xbox Research-მა მოდელით 10 000-ზე მეტი ღია გამოხმაურება და მიმოხილვა დაამუშავა გამოკითხვებიდან, Steam-იდან და Twitter/X-იდან. ხარისხით მოდელი GPT-6 Sol-ის კონკურენტი აღმოჩნდა, ამასთან 14-ჯერ უფრო სწრაფად მუშაობდა და 200-ჯერ ნაკლები დაჯდა.
  • ხარისხის კონტროლი: Copilot-ის გუნდი ჩატისა და აგენტური პასუხების ხარისხს ზომავს. მათი ტესტებით, მოდელი GPT5.6 Luna-ს კონკურენტია და 100-ჯერ უფრო სწრაფია.
  • ინციდენტებზე რეაგირება: მორიგე ინჟინრები AI-ს ლოგებიდან, ტიკეტებიდან, ზარებიდან და შეტყობინებებიდან საჭირო ცოდნის მოსაძიებლად იყენებენ. ამ ამოცანაში მოდელმა LLM-ზე უკეთესი და სწრაფი შედეგი აჩვენა.
  • სამეცნიერო კვლევა: Microsoft Discovery-ში აგენტი წინა ექსპერიმენტს რუბრიკით აფასებს და მიდგომას ცვლის. აქ მოდელი LLM-ზე დაფუძნებულ შეფასებაზე 46-ჯერ უფრო თანმიმდევრული აღმოჩნდა, სამჯერ უფრო სწრაფად იმუშავა და ადაპტური ხელახალი დაგეგმვა თითქმის ოთხჯერ დააჩქარა.

სად შეიძლება Microsoft-Decision-1-ის გამოყენება

Microsoft საკმაოდ ფართო ჩამონათვალს გვთავაზობს. მთავარი იდეა ისაა, რომ იქ, სადაც შედეგი წინასწარ განსაზღვრული ვარიანტებიდან უნდა აირჩეს, სრული LLM-ის გამოყენება ხშირად ზედმეტად ნელი და ძვირია.

  • აგენტების კონტროლი: შეფასება, უნდა გააგრძელოს, შეწყვიტოს, ხელახლა სცადოს თუ არა აგენტმა ამოცანა, ან გადასცეს იგი სხვა მოდელს, ხელსაწყოს თუ ადამიანს.
  • მოდელების მარშრუტიზაცია: შემოსული მოთხოვნისთვის საუკეთესო მოდელის შერჩევა ხარისხის, ფასისა და სიჩქარის მიხედვით.
  • AI-ის შეფასება: გენერირებული პასუხის შემოწმება კრიტერიუმებით და მისი მიღება, გადაკეთება ან უარყოფა.
  • განზრახვის ანალიზი: იმის გარკვევა, რისი გაკეთება სურს მომხმარებელს.
  • კონტენტის კლასიფიკაცია და ფილტრაცია: თემის ან პოლიტიკის მიხედვით დაჯგუფება და გადაწყვეტა, გამოჩნდეს თუ არა მასალა.
  • უსაფრთხოების სკრინინგი: მოთხოვნებისა და ქმედებების რისკის მიხედვით დაშვება, დაბლოკვა ან ესკალაცია.
  • კომპიუტერისა და ინტერფეისის მართვა: ეკრანზე შემდეგი მოქმედების არჩევა ვარიანტებიდან.
  • ძიების რელევანტურობა, რეკომენდაციები, კოდის სკანირება და რობოტიკა – ასევე იმ სფეროების სიაშია, რომლებსაც Microsoft ასახელებს.

ხელმისაწვდომობა და ფასი

Microsoft-Decision-1 უკვე ხელმისაწვდომია Microsoft Foundry-ში და OpenRouter-ის მეშვეობით. დოკუმენტაცია Microsoft Learn-ზეა განთავსებული.

ფასწარმოქმნა უჩვეულოდ მარტივია: შემავალი ტოკენები მილიონზე 0,042 აშშ დოლარი ღირს, გამომავალი ტოკენები კი უფასოა. ეს ლოგიკურია, რადგან მოდელი გრძელ ტექსტს არ წერს და მხოლოდ ვარიანტების ალბათობებს აბრუნებს.

რას ნიშნავს ეს დეველოპერებისთვის

Microsoft-ის აზრით, აგენტური AI-ის ეპოქაში ღირებულება ერთ-ერთი მთავარი ფაქტორია, რომელიც AI-ის გამოყენების წესს განსაზღვრავს. სულ უფრო მნიშვნელოვანი ხდება კონკრეტული ამოცანისთვის სწორი მოდელის შერჩევა, და არა ყველაფრისთვის ერთი დიდი მოდელის გამოყენება.

Microsoft-Decision-1 სწორედ ამ ლოგიკას მიჰყვება: დიდი მოდელი ფიქრობს და წერს, პატარა და სწრაფი მოდელი კი წყვეტს, რა უნდა მოხდეს შემდეგ. კომპანია ამბობს, რომ მოდელს განახლებებს გაუკეთებს და ხარისხის, კალიბრაციისა და ფასის კიდევ უფრო გაუმჯობესებას დეველოპერების უკუკავშირით გეგმავს.

AI წაიკითხე მეტი როგორ მუშაობს ხელოვნური ინტელექტი AI-ის, დიდი ენობრივი მოდელებისა და ნეირონული ქსელების ახსნა ქართულ ენაზე.

LLM.GE - გზამკვლევი ხელოვნურ ინტელექტში

LLM.GE არის ქართულ-ენოვანი პლატფორმა, რომელზეც ყოველდღიურად ქვეყნდება AI და ტექნოლოგიების სიახლეები, ახალი მოდელების, კვლევებისა და პრაქტიკული ინსტრუმენტების შესახებ. საიტის მიზანია, მკითხველმა ერთ სივრცეში მიიღოს ზუსტი, გასაგები და დროული ინფორმაცია ტექნოლოგიური ინდუსტრიის მთავარი მოვლენების შესახებ

გამოიწერე სიახლეები

გამოწერის გაუქმება ნებისმიერ დროს შეგიძლიათ Privacy Policy

×