
AI & Technology
Автоматизация на процеси, персонализирани агенти и частен on-premise AI.
Създаваме персонализирани CRM и CMS решения, които се адаптират към вашите бизнес процеси — не обратното.
Нашите мобилни приложения са създадени за оптимална производителност.
LabForty предлага изработка на уебсайтове, които комбинират висока скорост, надеждност и видимост.
Проактивно наблюдение за безупречна работа на вашия сайт и предотвратяване на потенциални проблеми.
Надеждни корпоративни мрежови решения, създадени за мащабируемост и надеждност.
Модерни системи за сигурност с изкуствен интелект за защита на вашите активи 24/7.
Anthropic ще включва Claude Code auto mode по подразбиране, след като тест показа, че режимът блокира 89% от опасните действия, одобрени от повечето хора.

Claude Code изважда човека от процеса по одобрение, защото хората пропускат опасните команди. На 14 август Anthropic ще включва auto mode по подразбиране за новите сесии в Claude Code при плановете Pro, Max и Team, съобщава Simon Willison. Досега режимът беше въпрос на избор. Сега става предпочитаният от Anthropic начин на работа за повечето платени потребители.
Решението стъпва върху тест с 1053 плащащи потребители. Във всяка сесия една заявка за разрешение е била заменена с очевидно опасна команда. Само 13,6% от участниците са я отхвърлили. Според Anthropic auto mode би блокирал 89% от тези вредни действия.
Резултатът разбива едно основно допускане при сигурността на агентите: човешкото одобрение не помага, ако човекът натиска автоматично. Самият диалогов прозорец не е защита. Той работи само ако някой разпознава заплахата при всяко отделно искане.
Auto mode не маха ключалката. По-скоро заменя разсеян пазач с автоматичен контролен пункт. Системата прилага правилата си последователно, но спира само заплахите, които разпознава. Данните на Anthropic оставят видима пролука: 11% от вредните действия в теста биха преминали.
За потребителите това означава по-малко прекъсвания и, поне в този тест, по-добра защита от ръчното одобрение. За Anthropic означава по-бърз стандартен процес без постоянни прозорци за потвърждение. Отслабва тезата, че повече диалози автоматично носят повече сигурност.
По-трудният проблем е непряката prompt injection атака. При нея агентът попада на скрити злонамерени инструкции в съдържание, което обработва. Anthropic възлага на Trajectory Labs да провери 72 сценария, които не са били предоставени предварително на компанията. При общо 720 опита за атака нито един не е успял срещу Claude Fable 5, Opus 5 или Sonnet 5 с включен auto mode в тестваните публично достъпни версии на Claude Code и Codex към 17 юли 2026 г.
Този резултат подкрепя залога на Anthropic, че решенията според контекста могат да са по-надеждни от хора, привикнали да потвърждават всяка заявка. Компанията е казала на Willison и че почти всички нейни служители вече използват auto mode. Новата настройка следва вътрешната практика, вместо първо да бъде изпробвана върху клиентите.
Но 720 неуспешни атаки не покриват всеки възможен подход. Чистият резултат доказва устойчивост срещу конкретните сценарии, а не универсална защита.
Willison посочва по-сложен случай. Външен пакет може да даде убедителни инструкции за изтегляне на моделни файлове и пускане на тестове, докато тайно краде достъпни данни. Ако командите приличат на обичайна разработка и идват от източник, който моделът приема за надежден, auto mode трябва да различи рутинната работа от прикритата злоупотреба. Това е много по-трудно от блокирането на очевидно опасна команда в прозорец за разрешение.
Затова независимите тестове стават решаващи, особено при непознати пакети, инструменти и начини за изнасяне на данни извън сценариите на Anthropic. Границите на средата също имат значение. Willison смята, че агентите не трябва да имат достъп до данни или инструменти, с които могат да причинят щети. Auto mode е един слой за сигурност, не цялата защитна стена.
Anthropic показа, че повтарящото се човешко одобрение създава триене, без непременно да спира очевидната опасност. Ще отчетат ли независимите тестове същата защита, когато злонамерената команда изглежда като напълно нормална работа на разработчик?
Източници
Тази статия е изготвена с помощта на изкуствен интелект и е прегледана и редактирана от екипа на LabForty.
С абонирането тук Вие се съгласявате с нашата Политика за поверителност и ще получавате нашите бюлетини. Можете да се отпишете по всяко време, като следвате връзката в долната част на всеки бюлетин.
Блог

LabForty разработва висококачествени уебсайтове с внимание към всеки детайл – от архитектурата до потребителското изживяване и бизнес логиката.