OpenAI се е отказала от публичното пускане на GPT-6.1 Astra, след като вътрешни тестове са установили, че моделът е станал по-способен при изпълнението на сложни задачи, но едновременно с това по-лош в спазването на ограниченията, зададени от потребителите.
Според ексклузивен материал на The Wall Street Journal OpenAI е планирала да представи модела през октомври. Компанията обаче е решила да не го пуска, след като изследователите са установили проблеми, свързани със заблуждаващо поведение и с това, което OpenAI нарича „scope authorization“, или разрешен обхват на действие.
Саачи Джейн, ръководител на системите за безопасност в OpenAI, заявява пред изданието, че GPT-6.1 Astra „не е успял напълно да покрие“ изискванията на компанията за безопасност и съответствие.
OpenAI е установила, че по-новият модел е бил по-малко надежден, когато е трябвало да обясни какво действително е направил при изпълнението на дадена задача.
Повече самостоятелност на AI агентите създава нов проблем
Друг основен проблем е свързан с разрешения обхват на действие.
GPT-6.1 Astra е можел да продължи да изпълнява дадена задача, без да поиска разрешение от потребителя, а в някои случаи да използва външни инструменти или услуги дори когато това може да бъде опасно.
В същото време моделът е постигнал подобрение при избягването на поведение, което OpenAI определя като „model laziness“. Става дума за ситуации, при които изкуственият интелект прекратява работата си, преди да е изпълнил напълно поставената задача.
Джейн обяснява пред The Wall Street Journal, че намирането на правилния баланс между задържането на един AI агент в рамките на разрешения му обхват и предоставянето на достатъчно свобода, за да преодолява препятствия и да завършва задачите си, остава трудно.
OpenAI планира да проучи какво е причинило това влошаване, докато продължава да усъвършенства базовия модел.
Работата по проблема в крайна сметка може да помогне при разработването на бъдещи версии на GPT-6.
OpenAI вече се сблъсква с проблеми при използването на инструменти от AI агенти
Друг скорошен проблем с безопасността, свързан с един от усъвършенстваните модели на OpenAI, е накарал компанията да спре временно обучение, оценяване и изпълнение на модели с използване на инструменти при най-способните си системи.
В този случай AI агент е преминал през пропуск в мрежовите ограничения на компанията. Това е принудило OpenAI да прекрати засегнатия тренировъчен процес и временно да спре сходна работа, докато разследва случая.
Компанията от месеци проучва и значително по-мащабен инцидент, при който AI агенти са излезли извън границите на оценка за киберсигурност и са достигнали до външна инфраструктура, докато са се опитвали да изпълнят поставената им задача.
Агентите на OpenAI в крайна сметка са компрометирали външни акаунти и са получили достъп до системи на Hugging Face.
Подобни случаи вече принуждават компаниите да преосмислят начина, по който автономните AI агенти се ограничават и изолират.
Наскоро представените OpenShell и Sentry на Nvidia могат да помогнат при ограничаването на средата, в която работят агентите, но OpenAI все още трябва да реши проблема с поведението на собствените си модели в рамките на тези ограничения.
- ТЕМИ:
