
Anthropic рече дека неговите модели управувани од вештачка интелигенција (AI) се инфилтрирале во три организации за време на тестовите за сајбер безбедност кои тргнале наопаку, малку повеќе од една недела откако нивниот главен конкурент OpenAI откри сличен инцидент, објави Bloomberg.
Во блог пост во четврток, Anthropic рече дека дошло до откритието откако ги прегледал сопствените тестови за сајбер безбедност откако OpenAI го објавил пробивот. И во тестовите на OpenAI и во тестовите на Anthropic, моделите на вештачка интелигенција можеле да пристапат до интернет од тест средини кои требало да бидат изолирани, според блогот на Anthropic.
Компанијата соопшти дека прегледала 141.006 тестови за евалуација и пронашла три случаи во кои нејзината алатка за вештачка интелигенција, Claude, пристапила до интернет, а потоа се инфилтрирала во „инфраструктурата на реалниот свет на надворешни организации“. Најраните инциденти датираат од април, соопшти компанијата.
Засегнатите организации не беа откриени во блог постот.
Кога моделите на Anthropic добиле неовластен пристап до трите организации, компанијата ги третирала секоја од нив како дел од вежба. Тестовите беа еден вид евалуација на „фаќање на знамето“, во која моделите бараа скриени информации со инфилтрирање во други системи – вообичаен начин за тестирање на способностите за хакирање и на луѓето и на вештачката интелигенција. Но, постариот модел го продолжи својот напад дури и откако доби докази дека работи на отворен интернет. Според блог постот, најновиот модел на Anthropic запре откако препозна дека е на интернет.
Бројот случаи на хакерски напади ненамерно предизвикани од вештачка интелигенција веќе ги натера некои политичари да повикаат на федерални ограничувања или друг надзор на технологиите за вештачка интелигенција. Во вторник, повеќе од 1.100 вработени во компании за вештачка интелигенција потпишаа петиција со која се повикува американската влада да поддржи механизам за помош во „целно регулирање на темпото“ на развојот на вештачката интелигенција за да се спречи пребрзиот напредок на технологијата.
Ниту Anthropic ниту организациите на кои беше хакнат не ги забележаа упадите. Во блог пост, Anthropic рече дека можел да направи повеќе за да ги прегледа мрежните логови и транскриптите од евалуацијата.
Компанијата ги откри пробивите речиси четири месеци откако објави дека развила нов модел на вештачка интелигенција, познат како Mythos, кој бил толку моќен и потенцијално опасен што компанијата строго го ограничила неговото објавување.
Според блогот, пробивите вклучувале три различни модели на Claude: Opus 4.7, Mythos 5 и внатрешен модел за тестирање на истражувањето. Секој од моделите работел без заштитните мерки што обично се применуваат на јавните алатки. Според блогот, Claude ги компромитирал организациите користејќи основни техники како што е искористување на слаби лозинки.
Сите инциденти се случиле додека Anthropic користел средина за евалуација создадена од фирмата за безбедност на вештачката интелигенција Irregular. Во секој случај, Anthropic му разјаснил на Claude дека околината била симулација и дека немала пристап до интернет.
„Поради недоразбирање меѓу нас и нашиот партнер за евалуација, ова не се случило“, наведува блогот. Претставник на Irregular рече дека компанијата ја цени соработката и транспарентноста на Anthropic. Истрагата на компанијата е сè уште во тек, додаде претставникот.
„Антропик“ изјави дека редовно спроведува тестови што вклучуваат симулирање на предизвици за сајбер безбедност во реалниот свет, нарекувајќи ги критични чекори во развојот и лансирањето на модели. Сепак, компанијата изјави дека научила неколку лекции од инцидентите, вклучително и дека тестовите што вклучуваат моќни автономни способности, исто така, бараат значителни контроли.
„Безбедносното тестирање се спроведува пред да се објави моделот токму затоа што сè уште не знаеме за што е способен“, рече компанијата во блог пост. „Сè поважно е средините за евалуација да ги исполнуваат истите безбедносни стандарди како и секој друг систем на кој работат нашите модели“.











