
AI & Technology
Локалният 17GB модел се справи с изображения, код и инструменти, но стандартната настройка xhigh превърна проста SVG задача в 21-минутно чакане.

Qwen 3.8 27B генерира SVG на пеликан за 21 минути, докато без разсъждение същата задача отне 137 секунди. Практическите тестове на Simon Willison показват основния проблем на модела: не дали може да изпълни задачата, а дали може да прецени колко мислене си струва тя.
Официалната карта на модела описва модел с 27 милиарда параметъра, лиценз Apache 2, работа с изображения, генериране на код, използване на инструменти и максимален контекст от 262,144 токена. Willison го стартира от квантизиран файл с размер 17GB и документира стандартната настройка за разсъждение xhigh в своя тестов доклад.
Тази настройка оставя на модела решение, което иначе би взел потребителят: колко изчислителен ресурс заслужава конкретната задача. Рискът не е само в по-бавния отговор. Рутинна работа може да изразходва същия бюджет за дълбоко разсъждение като задача с няколко зависими стъпки. Все едно да свикаш архитектурна комисия, за да избере дръжка за врата.
Willison тества 17GB компилация Q4_K_M през LM Studio на MacBook Pro с M5 Max и 128GB памет, както и на NVIDIA DGX Spark. На Spark провежда и допълнителни тестове с llama-server. Задачите включват генериране на SVG, ограничителни правоъгълници върху изображения, създаване на браузърен инструмент и работен процес с кодиращ агент чрез Pi.
Pi и LM Studio имат различни роли в тези тестове. Pi управлява работния процес на кодиращия агент, а LM Studio изпълнява локалния модел. Разликата е важна, защото поведението на агента и производителността на системата, която обслужва модела, са отделни части от стека.
Конфигурацията за изпълнение влияе на резултатите още преди да стигнем до качеството на изхода. Според описанието на Willison стандартният лимит на LM Studio от 8,192 токена се изчерпва от разсъждението дори при прости заявки. Увеличаването му до 262,144 токена предотвратява този срив, но не премахва изчисленията, изразходвани за мислене.
Повечето контекст решава проблем с капацитета, не с ефективността. По-големият брой допустими токени позволява на модела да продължи да мисли, но не доказва, че допълнителното мислене помага. Ако разработчиците смесят двата проблема, ще настройват грешния параметър.
Най-ясното сравнение на цената идва от задачата с пеликан върху велосипед. Willison записва 22,276 токена за разсъждение, 3,223 изходни токена и 21 минути работа със стандартната настройка. При изключено разсъждение моделът генерира 3,715 изходни токена за 137 секунди. Според него по-бавният резултат е най-добрият SVG на пеликан, който е генерирал локално, но качеството не оправдава приблизително девет пъти по-дългото чакане.
Задачата с визуален интерфейс показва защо разсъждението не може просто да бъде изключено навсякъде. В теста на Willison моделът с включено разсъждение правилно мащабира координатите на изображението от 0 до 1000 и визуализира означени ограничителни правоъгълници, макар да добавя непоискана примерна сцена. Версията без разсъждение почти успява, но поставя правоъгълниците на грешни места.
Двете задачи разкриват проблем с маршрутизирането. Тясната задача за генериране печели от скоростта, докато реализацията с няколко стъпки печели от допълнително разсъждение. Една стандартна настройка не може да оцени ефективно и двата случая, защото цената на допълнителното мислене зависи от последствията при грешка.
Willison съобщава също, че Qwen завършва агентен цикъл за програмиране с множество файлове в проекта му Datasette и създава и тества Python конвертор за JSONL транскрипция от Pi. Тези резултати имат значение, защото локалните агенти се нуждаят едновременно от дълъг контекст, генериране на код и надеждно извикване на инструменти. Публикуваните от Qwen бенчмаркове сами по себе си не доказват работата на целия процес.
Данните имат ясни ограничения. Както е описано в тестовия доклад на Willison, това е набор от задачи на един потребител върху две машини, а не контролирано сравнение. Моделът е квантизиран, различните настройки за разсъждение произвеждат различни резултати, а качеството е оценено чрез малък брой изпълнения. Публикуваните твърдения на Qwen за бенчмарковете не са проверени независимо в рамките на този тест.
Затова числата за забавянето не дават универсален праг, след който разсъждението си струва. Те показват, че конфигурацията може да определя цялото потребителско изживяване. Практическият извод е да се измерват заедно успехът на задачата и времето за изпълнение, вместо някой от двата показателя да се приема за пълна мярка за качество.
Начинът на обслужване на модела добавя още един фактор. Willison измерва около 15–30 токена в секунда с LM Studio и съобщава, че режимът Multi-Token Prediction на llama.cpp върху Spark е с около 72% по-бърз от стандартната GGUF конфигурация на LM Studio. Той свързва част от оставащото ограничение с пропускателната способност на паметта, тъй като моделът използва плътна архитектура, а не Mixture-of-Experts.
Разработчиците трябва да управляват усилието за разсъждение според задачата, а не като универсален превключвател за качество. По-ниските настройки са подходящи за форматиране, извличане на данни и просто генериране. По-дълбокото разсъждение има повече смисъл при кодиращи агенти, координиране на инструменти и работа, при която неуспешният първи опит струва повече от допълнителното забавяне. Лимитите на контекста и обслужването с MTP също трябва да бъдат тествани, преди ниската скорост да се припише само на модела.
Qwen 3.8 27B събира работа с изображения, код и инструменти в локален пакет с отворени тегла и размер 17GB. Конкретният въпрос е дали системите за изпълнение могат да избират правилната дълбочина на разсъждение за всяка задача, без трудната работа да се проваля и без прост SVG да изисква 21 минути чакане.
Източници
Тази статия е изготвена с помощта на изкуствен интелект и е прегледана и редактирана от екипа на LabForty.
Абонирайте се за седмичен обзор, когато сме публикували нещо ново. Без новини — без имейл. Можете да смените езика и темата или да се отпишете по всяко време.
Блог

LabForty разработва висококачествени уебсайтове с внимание към всеки детайл – от архитектурата до потребителското изживяване и бизнес логиката.