Alibaba-ს Qwen-მა Qwen Intelligence წარადგინა – სმარტფონებისთვის შექმნილი AI სისტემა, რომელიც რთული დავალებების დაგეგმვას, აპლიკაციებში მოქმედებასა და ვიზუალური მასალის შექმნას აერთიანებს. საწყის ეტაპზე სისტემა სამი სპეციალიზებული აგენტით მუშაობს: Mobile Planner Agent, Mobile-Use Agent და Mobile Creative Agent.
თითოეულს განსხვავებული ფუნქცია აქვს. ერთი მომხმარებლის მოთხოვნას შესასრულებელ ნაბიჯებად გარდაქმნის, მეორე ამ ნაბიჯებს აპლიკაციებში ასრულებს, მესამე კი ტექსტური მითითებით გამოსახულებას ქმნის. აგენტებთან ერთად Qwen შეფასების ბენჩმარკების ნაკრებსაც ხსნის, რომელიც დაგეგმვას, აპლიკაციებს შორის მუშაობას, რეალურ მოწყობილობებზე შესრულებასა და უსაფრთხოებას მოიცავს.
სარჩევი
როგორ მუშაობს Qwen Intelligence-ის სამი AI აგენტი
Mobile Planner Agent – რთული დავალებების დაგეგმვა
Mobile Planner Agent მომხმარებლის მოთხოვნას აანალიზებს, რთულ დავალებას მცირე ნაბიჯებად ყოფს და მათ შესრულებას კოორდინაციას უწევს. მისი როლი განსაკუთრებით მნიშვნელოვანია მაშინ, როდესაც შედეგის მისაღებად რამდენიმე ინსტრუმენტის გამოყენება და მოქმედებების სწორი თანმიმდევრობაა საჭირო.
პროექტის ტექნიკური აღწერის თანახმად, დაგეგმვის აგენტი მუშაობს ინსტრუმენტებთან, მუდმივ მეხსიერებასთან, მრავალჯერ გამოსაყენებელ პროცედურებთან და სპეციალიზებულ ქვეაგენტებთან. შესრულებისას ის ითვალისწინებს მიღებულ შედეგებს, ინარჩუნებს დავალებისთვის მნიშვნელოვან პირობებს და ინსტრუმენტის შეცდომის შემთხვევაში მიდგომას ცვლის.
მაგალითად, პროექტის დემოებში ნაჩვენებია, როგორ ელოდება აგენტი ფაილების ჩამოტვირთვის დადასტურებას და მხოლოდ შემდეგ გადასცემს მათ სახელებსა და საქაღალდეების შესახებ ინფორმაციას შემდეგ აპლიკაციას. ასეთი შემოწმება საჭიროა, რათა მომდევნო მოქმედება უკვე დასრულებულ ნაბიჯს დაეყრდნოს.
Qwen-ის ანონსის მიხედვით, Mobile Planner Agent პირველ ადგილზეა MobilePA-Bench, MobilePA-Bench Business და Memory შეფასებებში. გამოქვეყნებულ ტექნიკურ აღწერაში Qwen-Planner-Agent-ის 27B ვერსიის საერთო შედეგი MobilePA-Bench-ზე 77.05%-ია.
Mobile-Use Agent – მოქმედება აპლიკაციებში
Mobile-Use Agent უშუალოდ დავალებების შესრულებაზეა პასუხისმგებელი. Qwen მის მიდგომას აღწერს როგორც API-first სისტემას GUI-ზე გადასვლის შესაძლებლობით: აგენტი უპირატესობას ანიჭებს სერვისთან პროგრამული ინტერფეისით დაკავშირებას, საჭიროების შემთხვევაში კი აპლიკაციის გრაფიკულ ინტერფეისს იყენებს.
მარტივად რომ ვთქვათ, შესაბამისი პროგრამული წვდომის არსებობისას აგენტს შეუძლია ფუნქციას პირდაპირ მიმართოს. სხვა შემთხვევაში ის ეკრანზე არსებულ ელემენტებთან ურთიერთქმედებს, მაგალითად, მენიუში გადადის ან საჭირო ღილაკს ირჩევს.
ანონსში მითითებულ Qwen-UI-Agent-ის ტექნიკურ გვერდზე წარმოდგენილია სხვადასხვა აპლიკაციის დამაკავშირებელი დავალებები. ერთ-ერთ მაგალითში აგენტი სასტუმროებს ეძებს და შემდეგ რუკის სერვისით ამოწმებს, რამდენი დრო სჭირდება თითოეული მათგანიდან კონკრეტულ ადგილამდე ფეხით მისვლას.
Mobile Creative Agent – გამოსახულების შექმნა ერთი წინადადებით
Mobile Creative Agent შემოქმედებით დავალებებს ემსახურება. Qwen-ის აღწერით, მომხმარებელს შეუძლია მოთხოვნა ერთი წინადადებით ჩამოაყალიბოს და გამოსაყენებლად მზად გამოსახულება მიიღოს.
კომპანიის განცხადებით, გამოსახულების გენერაციას 3 წამი სჭირდება, რაც წამყვან კონკურენტებთან შედარებით დაახლოებით ორჯერ სწრაფია. მოკლე ანონსში ამ შედარებისთვის გამოყენებული კონკურენტები და ტესტირების პირობები დაზუსტებული არ არის.
ამ მიმართულების ტექნიკურ მასალად Qwen მიუთითებს arXiv-ზე გამოქვეყნებულ კვლევას გამოსახულებების გენერაციის შესახებ. ნაშრომი პიქსელურ სივრცეში მომუშავე დიფუზიური მოდელების სწავლებას იკვლევს და განიხილავს, როგორ შეიძლება გენერაციის დაჩქარება ხარისხის შენარჩუნებით.
რა შედეგები აქვს Qwen Intelligence-ს მობილურ დავალებებში
Mobile-Use Agent-ისთვის Qwen-ის განცხადებაში სამი ბენჩმარკის შედეგია მოყვანილი. ისინი მობილურ გარემოში დავალებების შესრულების წარმატებას ასახავს:
- MobileWorld – 82.1%.
- MobileWorld-Real – 92.2%.
- AndroidDaily – 97.2% განცხადების მიხედვით.
AndroidDaily-ის შემთხვევაში წყაროებს შორის განსხვავებაა: ანონსში მითითებულია 97.2%, ხოლო Qwen-UI-Agent-ის ტექნიკურ გვერდზე – 97.5%. MobileWorld-ისა და MobileWorld-Real-ის ზემოთ ჩამოთვლილი მაჩვენებლები ტექნიკურ გვერდზეც დასტურდება.
ცალკე Qwen ასახელებს დავალებების თავიდან ბოლომდე წარმატებით შესრულების 90%-იან მაჩვენებელს. ეს კომპანიის მიერ გამოქვეყნებული შედეგია; მის შესაფასებლად მნიშვნელოვანია კონკრეტული დავალებებისა და ტესტირების პირობების გათვალისწინება.
ღია ბენჩმარკები – რას ამოწმებს თითოეული ტესტი
Qwen Intelligence-ის წარდგენასთან ერთად კომპანია ოთხი ბენჩმარკის გახსნის შესახებ აცხადებს: MobilePA-Bench, MobileWorld, MobileWorld-Real და MobileWorld-Safety. ისინი მობილური აგენტების მუშაობას სხვადასხვა კუთხით აფასებს.
MobilePA-Bench – დაგეგმვა და მეხსიერების გამოყენება
MobilePA-Bench ამოწმებს ინსტრუმენტების გამოყენებას, მომხმარებლის შესახებ შენახული კონტექსტის გათვალისწინებას, მზა პროცედურების შერჩევასა და ქვეაგენტების კოორდინაციას. ოფიციალური აღწერის მიხედვით, ის მოიცავს 1,705 დავალებასა და 212 ინსტრუმენტს.
შეფასება ითვალისწინებს იმასაც, რა შეიცვალა გარემოში აგენტის მოქმედების შემდეგ. ამგვარად მოწმდება, რამდენად სწორად შესრულდა მოთხოვნა და როგორ რეაგირებდა აგენტი მუშაობისას მიღებულ ინფორმაციაზე.
MobileWorld – რამდენიმე აპლიკაციის დაკავშირება
MobileWorld მრავალსაფეხურიან მობილურ დავალებებს აფასებს. ის მოიცავს აპლიკაციებს შორის მუშაობას, მომხმარებელთან დამატებითი ინფორმაციის დაზუსტებასა და გარე ინსტრუმენტების გამოყენებას.
ბენჩმარკში გაერთიანებულია 201 დავალება 20 აპლიკაციაში. მისი კოდი ხელმისაწვდომია GitHub-ზე, ხოლო შედეგების შედარება პროექტის ოფიციალურ გვერდზეა შესაძლებელი.
MobileWorld-Real – შესრულება რეალურ მოწყობილობებზე
MobileWorld-Real აგენტებს რეალურ Android მოწყობილობებზე ამოწმებს. ის მოიცავს 409 დავალებასა და 104 აპლიკაციას, სადაც მუშაობაზე გავლენას ახდენს ცვალებადი ინტერფეისი, ამომხტარი ფანჯრები, ანგარიშის მდგომარეობა და ქსელის პირობები.
ეს შეფასება აჩვენებს, როგორ უმკლავდება აგენტი ყოველდღიურ გამოყენებასთან დაკავშირებულ დაბრკოლებებს. დავალებები მოიცავს ინფორმაციის შედარებას, რამდენიმე ნაბიჯის შესრულებასა და აპლიკაციებს შორის კოორდინაციას.
MobileWorld-Safety – უსაფრთხოების შეფასება
MobileWorld-Safety ნაკრების უსაფრთხოებაზე ორიენტირებული ნაწილია. Qwen მას დანარჩენ ბენჩმარკებთან ერთად ასახელებს, თუმცა მოწოდებულ ანონსში კონკრეტული ტესტები და შედეგები აღწერილი არ არის.
აგენტებისა და შეფასების პროექტების შესახებ დამატებითი ინფორმაცია თავმოყრილია Qwen Intelligence-ის ოფიციალურ საიტზე და შესაბამის ტექნიკურ გვერდებზე.
სხვა თემები
Qwen3.8-Flash – Qwen4-ის არქიტექტურის ადრეული ვერსია
Qwen3.8-27B-ის ღია წონები ხელმისაწვდომია
Qwen3.8-Max წარადგინეს – Alibaba-ის ახალი AI მოდელი
