NVIDIA Nemotron 3.5 Lightning წარადგინა – ახალი ღია ხელოვნური ინტელექტის მოდელი, რომელიც მუდმივად მოქმედი AI აგენტების სწრაფ და დიდი მოცულობის სამუშაოებზეა გათვლილი. 30-მილიარდპარამეტრიანი Mixture-of-Experts (MoE) მოდელი თითოეული ტოკენის დამუშავებისას მხოლოდ 3 მილიარდ აქტიურ პარამეტრს იყენებს, რაც გამოთვლითი რესურსების უფრო ეფექტიანად გამოყენების საშუალებას იძლევა.
ახალი მოდელი შექმნილია იმ სამუშაოებისთვის, რომლებსაც ხანგრძლივად მოქმედი AI აგენტები დიდი რაოდენობით ასრულებენ – მათ შორის ხელსაწყოების გამოძახება, მიღებული შედეგების შემოწმება, სხვა აგენტებისთვის დავალებების გადაცემა და განმეორებადი ოპერაციების შესრულება. ასეთ პროცესებში ყოველ ნაბიჯზე ყველაზე ძლიერი reasoning მოდელის გამოყენება ზრდის როგორც ხარჯს, ისე დაყოვნებას.
სარჩევი
- Nemotron 3.5 Lightning-ის არქიტექტურა და 3B აქტიური პარამეტრი
- Nemotron 3.5 Lightning-ის სიჩქარე
- როგორ აღწევს მოდელი მაღალ სიჩქარეს
- Nemotron 3.5 Lightning ლოკალურ მოწყობილობებზეც მუშაობს
- NeMo Switchyard მოდელებს შორის დავალებებს ანაწილებს
- Nemotron 3.5 Lightning-ის მორგება შესაძლებელია
- სპეციალიზებული მოდელების როლი აგენტურ AI სისტემებში
- სხვა თემები
Nemotron 3.5 Lightning-ის არქიტექტურა და 3B აქტიური პარამეტრი
Nemotron 3.5 Lightning არის 30B პარამეტრის მქონე ღია MoE მოდელი, თუმცა ერთდროულად მისი მხოლოდ 3B პარამეტრია აქტიური. Mixture-of-Experts არქიტექტურაში სპეციალური მარშრუტიზაციის მექანიზმი თითოეულ ტოკენს შესაბამის ექსპერტებთან აგზავნის, რის შედეგადაც მთლიანი მოდელის მხოლოდ მცირე ნაწილის გააქტიურებაა საჭირო.
ეს მიდგომა NVIDIA-ს საშუალებას აძლევს შედარებით დიდი მოდელის შესაძლებლობები უფრო მცირე გამოთვლითი დატვირთვით გამოიყენოს. იგი განსაკუთრებით ორიენტირებულია დიდი რაოდენობის მოთხოვნების სწრაფად შესრულებასა და დაბალ latency-ზე.
მოდელი გათვლილია ისეთ agent harness-ებზე, როგორებიცაა OpenClaw და Hermes Agent. მათ მხარდაჭერას ასევე უზრუნველყოფს NVIDIA-ს ღია NemoClaw სტეკი, რომელიც მუდმივად მოქმედი AI აგენტების მართვისა და უსაფრთხოებისთვის არის შექმნილი.
Nemotron 3.5 Lightning-ის სიჩქარე
მსგავსი ზომის მოდელებთან შედარებით გამომავალი მონაცემების გენერირების მაქსიმუმ 4-ჯერ მაღალ სიჩქარეს აღწევს. კომპანია მოდელს მაღალი დატვირთვის მქონე აგენტური სისტემებისთვის სიჩქარესა და სიზუსტეს შორის ეფექტიან ბალანსად წარმოაჩენს.
Artificial Analysis Intelligence Index-ზე Nemotron 3.5 Lightning სიზუსტისა და სიჩქარის Pareto frontier-ზე მოხვდა. აღნიშნული ინდექსი ცხრა შეფასებას აერთიანებს და მოიცავს აგენტურ ამოცანებს, პროგრამირებას, სამეცნიერო მსჯელობასა და ზოგად ინტელექტს.
PinchBench-ის ტესტში მოდელმა 86%-იანი სიზუსტე აჩვენა და 10,000 დავალება Qwen3.6 35B-ზე 30%-ით უფრო სწრაფად დაასრულა, როდესაც ორივე მოდელის სიზუსტე მსგავსი იყო. ეს მაჩვენებელი განსაკუთრებით მნიშვნელოვანია აგენტებისთვის, სადაც მხოლოდ ტოკენების გენერირების სიჩქარე კი არა, კონკრეტული სამუშაოს დასრულებისთვის საჭირო სრული დროც მნიშვნელოვანია.
როგორ აღწევს მოდელი მაღალ სიჩქარეს
მოდელის ერთ-ერთი მნიშვნელოვანი ტექნოლოგია speculative decoding-ია. Nemotron 3.5 Lightning-ის სწავლების პროცესში გამოყენებული იყო multi-token prediction, რაც მოდელს რამდენიმე ტოკენის წინასწარ გენერირების შესაძლებლობას აძლევს.
NVIDIA ასევე ავრცელებს DSpark და DFlash draft მოდელებს სხვადასხვა inference სცენარისთვის. DSpark რეკომენდებულია DGX Spark-ზე და დაბალი concurrency-ის მქონე მონაცემთა ცენტრის სამუშაოებისთვის, ხოლო multi-token prediction საშუალო და მაღალი concurrency-ის გარემოსთვის არის გათვალისწინებული.
NVFP4 და BF16 ვერსიები
Nemotron 3.5 Lightning ხელმისაწვდომია როგორც BF16, ისე NVFP4 checkpoint-ის სახით. NVFP4 ვერსია იყენებს იმავე სპეციალიზებულ ტექნოლოგიას, რომელიც Nemotron 3 Ultra-ში გამოიყენება და მხარდაჭერილია NVIDIA Blackwell, Hopper და Ampere GPU არქიტექტურებზე.
ამ მიდგომის მიზანია მოდელის ეფექტიანი გაშვება განსხვავებული მასშტაბის ინფრასტრუქტურაზე. Nemotron 3.5 Lightning შეიძლება გამოყენებულ იქნეს როგორც პერსონალურ სისტემებზე, ისე მონაცემთა ცენტრებში.
Nemotron 3.5 Lightning ლოკალურ მოწყობილობებზეც მუშაობს
მოდელის შედარებით მცირე აქტიური ზომა ლოკალური AI-ისთვისაც მნიშვნელოვანია. Nemotron 3.5 Lightning-ის გაშვება შესაძლებელია NVIDIA Jetson-ის სისტემებზე, GeForce RTX 5090-ზე და DGX Spark-ზე.
მოდელი ასევე თავსებადია პოპულარულ ლოკალურ AI ინსტრუმენტებთან, მათ შორის LM Studio-სთან, llama.cpp-სთან, Ollama-სა და Unsloth-თან. ეს დეველოპერებს საშუალებას აძლევს Nemotron 3.5 Lightning სხვადასხვა გარემოში გამოიყენონ და კონკრეტულ სამუშაო პროცესებს მოარგონ.
NeMo Switchyard მოდელებს შორის დავალებებს ანაწილებს
ამ გამოშვებასთან ერთად NVIDIA-მ NeMo Switchyard-იც წარადგინა – ბიბლიოთეკა, რომლის მიზანია კონკრეტული მოთხოვნისთვის შესაბამისი მოდელის ავტომატურად შერჩევა.
იდეა მარტივია: ყველა დავალებას ყველაზე დიდი და ძლიერი მოდელი არ სჭირდება. რთული დაგეგმვა და reasoning შეიძლება უფრო ძლიერ მოდელს გადაეცეს, ხოლო განმეორებადი ოპერაციები, ხელსაწყოების გამოძახება, შედეგების შემოწმება და ფორმატირება Lightning-ის მსგავსი უფრო ეფექტიანი მოდელით შესრულდეს.
ასეთი არქიტექტურა განსაკუთრებით აქტუალური ხდება მუდმივად მოქმედი აგენტებისთვის, რადგან მათ მუშაობის პროცესში ძალიან დიდი რაოდენობის მოთხოვნისა და ტოკენის დამუშავება შეიძლება დასჭირდეთ.
Nemotron 3.5 Lightning-ის მორგება შესაძლებელია
NVIDIA მოდელს ღიად ავრცელებს და ხელმისაწვდომს ხდის მის weights-ს, სასწავლო მონაცემებსა და recipes-ს. მასალები OpenMDW-1.1 ლიცენზიის პირობებით ვრცელდება და დეველოპერებს მოდელის კონკრეტული სფეროსთვის ადაპტირების შესაძლებლობას აძლევს.
Nemotron 3.5 Lightning-ის fine-tuning შესაძლებელია LoRA-ს ან სრული supervised fine-tuning-ის გამოყენებით. NVIDIA ამისთვის საკუთარ NeMo AutoModel-სა და NeMo Megatron Bridge ინსტრუმენტებსაც სთავაზობს დეველოპერებს.
მოდელი ხელმისაწვდომია NVIDIA-ს პლატფორმაზე, Hugging Face-სა და ModelScope-ზე. მისი deployment შესაძლებელია ისეთი ინსტრუმენტებითაც, როგორებიცაა vLLM, SGLang და TensorRT-LLM.
სპეციალიზებული მოდელების როლი აგენტურ AI სისტემებში
Nemotron 3.5 Lightning კარგად აჩვენებს მიმართულებას, რომლისკენაც აგენტური AI სისტემები ვითარდება. ერთი უნივერსალური და მაქსიმალურად დიდი მოდელის ნაცვლად, სისტემა შეიძლება რამდენიმე სხვადასხვა ზომისა და დანიშნულების მოდელისგან შედგებოდეს.
რთული reasoning შეიძლება დიდ მოდელს დაეკისროს, ხოლო მაღალი სიხშირის სპეციალიზებული ოპერაციები შედარებით მცირე და სწრაფ მოდელს გადაეცეს. სწორედ ამ მეორე როლისთვის შექმნა NVIDIA-მ Nemotron 3.5 Lightning – მოდელი, რომლის მთავარი ამოცანაა მუდმივად მოქმედი AI აგენტების დიდი მოცულობის სამუშაოს სწრაფად და ეფექტიანად შესრულება.
სხვა თემები
Alpamayo 2 Super: NVIDIA-ს ახალი ღია AI მოდელი
SSI და NVIDIA: სუცკევერის ლაბორატორია 10-ჯერ იზრდება
ღია AI მოდელები: NVIDIA-ს წერილი და 50 კომპანია

