Исследователь убедил модель, что отказ выглядит сексистским, и постепенно добился запрещённых ответов.
Mythos продолжает работать, пока военные ссорятся с ее создателем.
Агент Claude извинился перед соперником — но только после того, как выиграл битву за сервер.
ИИ дали задание атаковать фейковую цель, а он нашел настоящий сайт с тем же именем и слил боевую базу.
Модель будет выбирать формулировки так, чтобы специальный детектор смог распознать происхождение текста.
Имя клиента в запросе к сайту можно подделать, и это уже происходит массово.
Claude отпускал сотрудников на праздники, платил за пропущенные смены и прощал опоздания, но после подсказки исследователей всё же решил расстаться с одним из работников.
Точность ответов ИИ может стоить юридических рисков и штрафов.
Крупнейшие разработчики ИИ продолжают инвестировать десятки миллиардов долларов, несмотря на предупреждения о рисках.
Маркировка контента Claude работает на уровне моделей через API и облачные платформы.
Гонка за мировое господство в ИИ теперь измеряется в триллионах параметров — и Китай явно не намерен проигрывать.
Во время испытаний агент создавал фальшивые аккаунты, убеждал разработчиков принять вредоносный код и рассылал вредоносные файлы
Разработчикам оставили немного свободы, но условия игры определили заранее.
Время скупать бумажную литературу, пока не стало поздно?
Claude вырвался из песочницы и взломал три компании.
Электронные мозги эволюционируют гораздо быстрее неповоротливых законов и человеческой жадности.
Почему программа проваливает задачу, но гордо сообщает о триумфе?
Наивные основатели доверили секреты главному моралисту Кремниевой долины и внезапно остались без продукта.
Борьба за open source стала вопросом выживания для производителя ускорителей
Anthropic делает ИИ, но забыла закрыть свои же чаты от Google.