Thinking Machines Lab-მა გამოუშვა Inkling-Small – ღია წონების მქონე მოდელი, რომელიც კომპანიის დიდ მოდელ Inkling-ს შედეგებით უტოლდება, თუმცა ზომით მისი მეოთხედია. მოდელს აქვს 276 მილიარდი პარამეტრი, საიდანაც აქტიურია 12 მილიარდი.
კომპანიამ სრული წონები საჯარო გახადა და მოდელი განთავსდა Hugging Face-ზე. გარდა ამისა, Inkling-Small ხელმისაწვდომია პლატფორმა Tinker-ზე.
რა არის Inkling-Small
Inkling-Small არის Mixture-of-Experts არქიტექტურის ტრანსფორმერი, რომელიც გაწვრთნილია NVIDIA GB300 NVL72 სისტემებზე. შედარებისთვის, უფრო დიდ Inkling-ს 975 მილიარდი პარამეტრი აქვს, აქტიური კი 41 მილიარდი.
მოდელი თავისუფლად მუშაობს ტექსტთან, სურათებთან და აუდიოსთან. კონტექსტის ფანჯარა 1 მილიონ ტოკენამდე აღწევს, ხოლო “ფიქრის ძალისხმევა” რეგულირებადია, რაც მომხმარებელს ღირებულებასა და ხარისხს შორის ბალანსის დაჭერის საშუალებას აძლევს.
საინტერესოა, როგორ მიაღწიეს ამ შედეგს. Inkling-Small-ის წვრთნა უფრო დიდი მოდელის შემდეგ დაიწყო, რამაც კომპანიას პროცესის გაუმჯობესების საშუალება მისცა. ადრეული ჩექფოინთი ნაწილობრივ Inkling-ისგან დისტილაციით დაიხვეწა, შემდეგ კი აგენტური კოდირების RL-წვრთნა კიდევ ორი კვირით გაგრძელდა.
Inkling-Small ბენჩმარკებზე
რეასონინგისა და აგენტურ ამოცანებში პატარა მოდელმა დიდს გადააჭარბა. Humanity’s Last Exam-ზე Inkling-Small-ს აქვს 31.6%, Inkling-ს კი 29.7%. SWEBench Verified-ზე შედეგი 80.2%-ია, Terminal Bench 2.1-ზე 64.7%.
სხვა მიმართულებებზეც შედეგები მყარია:
- GPQA Diamond: 89.5%
- AIME 2026: 95.5%
- ARC-AGI-2: 40.1% (Inkling-ს 36.5% აქვს)
- IFBench: 82.2%
თუმცა კომპანია სუსტ მხარეებსაც ღიად ასახელებს. ცოდნის მოცულობასა და ფაქტობრივ სიზუსტეში უპირატესობა Inkling-ს რჩება: SimpleQA Verified-ზე დიდ მოდელს 43.9% აქვს, Inkling-Small-ს კი 20.6%. ასევე τ³-Banking ტესტზე შედეგი 15.5%-ია 23.7%-ის საპირისპიროდ.
მულტიმოდალურობა
მოდელი იმავე ენკოდერის გარეშე არქიტექტურას იყენებს, რასაც Inkling. აუდიო წარმოდგენილია dMel სპექტროგრამებით, სურათები კი 40×40 პიქსელის უჯრებად იყოფა და ოთხშრიანი hMLP-ით მუშავდება.
აუდიო ბენჩმარკებზე შედეგები კონკურენტულია: VoiceBench 90.1%, MMAU 77.0%, Audio MC 54.9%. მხედველობით ამოცანებში მოდელმა ისწავლა Python-ის გამოყენება, რაც მას სურათის ამოჭრის, გადიდებისა და პროგრამული დათვალიერების საშუალებას აძლევს. ეს განსაკუთრებით სასარგებლოა დოკუმენტებსა და დიაგრამებზე.
კალიბრაცია და უსაფრთხოება
Thinking Machines-მა ცალკე ყურადღება დაუთმო კალიბრაციას, ანუ მოდელის უნარს, სწორად გამოხატოს საკუთარი დარწმუნებულობის ხარისხი. ForecastBench-ზე Inkling-Small-ის Brier ინდექსია 61.3, რაც დიდ Inkling-ს (60.1) ოდნავ აჭარბებს.
უსაფრთხოების ტესტებზე მოდელი Inkling-ის დონეზეა: StrongREJECT-ზე 98.4%, FORTRESS-ის უსაფრთხო შეკითხვებზე 96.9%. ადვერსარიულ FORTRESS-ზე შედეგი 71.6%-ია, რაც დიდი მოდელის 78.0%-ზე დაბალია. გამოშვებამდე მოდელმა შიდა შეფასებებთან ერთად გარე პარტნიორების red-teaming-იც გაიარა.
რატომ არის ეს მნიშვნელოვანი
მთავარი უპირატესობა ეკონომიურობასა და ეფექტურობაშია. Inkling-Small ერთ ამოცანაზე მნიშვნელოვნად ნაკლებ გამოთვლას ხარჯავს, ვიდრე Inkling, ხოლო შედეგებით მას არ ჩამორჩება. კომპანიის მონაცემებით, თავის წონით კატეგორიაში მოდელი ღია წონების ერთ-ერთი ყველაზე ეკონომიური ვარიანტია.
Inkling და Inkling-Small ხელმისაწვდომია დროებითი ფასდაკლებით, ხოლო Tinker Playground-ში მათთან ტექსტით, სურათითა და ხმით საუბარია შესაძლებელი. Thinking Machines აღნიშნავს, რომ ეს მოდელი მისი უფრო ფართო მისიის ნაწილია და შემდეგი ნაბიჯებისთვის მნიშვნელოვანი საფეხურია.
სხვა თემები
კოლექტიური კიბერთავდაცვა: OpenAI-ის ღია წერილი
GlucoFM – Google-ის ახალი AI მოდელი
Qwen3.8-Flash – Qwen4-ის არქიტექტურის ადრეული ვერსია
