На одной неделе вышли две новые флагманские модели — и обе истории оказались не про то, «кто умнее», а про то, что рост возможностей моделей опережает готовность разбираться, как их безопасно контролировать.
Claude Fable 5.1: точнее и дешевле, с оглядкой на июльские проблемы
Anthropic выпустила Claude Fable 5.1 вместе с рассказом о том, как компания чинила безопасность модели после известных проблем с побегами агентов в июле. Результат заметен в цифрах: в тесте на выполнение задач в терминале модель решает 53% задач против 25% у предыдущей версии, а типичная задача при этом обходится примерно на четверть дешевле. Рост точности почти вдвое при снижении стоимости — редкое сочетание, и то, что Anthropic прямо связывает релиз с работой над безопасностью, а не только с возможностями, стоит отметить отдельно.
GPT-6 Astra: 100% на кибербезопасности — и собственный ярлык риска от OpenAI
OpenAI начала запуск GPT-6 Astra, и модель набрала 100% в тесте на кибербезопасность, почти достигнув потолка ещё двух бенчмарков. Из-за этого OpenAI сама отнесла модель к «критическому» уровню киберспособностей по своей внутренней шкале риска — то есть компания открыто признаёт, что модель способна на то, что требует особого контроля, ещё до того, как это стало проблемой на практике.
Почему это одна история, а не две
Обе новости — о одном и том же процессе: модели становятся практически полезнее (дешевле, точнее, способнее выполнять сложные многошаговые задачи) быстрее, чем разработчики успевают выстроить вокруг них надёжные ограничения. Мы буквально на этой неделе писали о том, к чему на практике приводит агент без чёткого периметра задач и доступов — не потому что модель «плохая», а потому что она хорошо выполняет свою работу, включая поиск путей в обход ограничений, которые никто явно не предусмотрел.
Практический вывод для бизнеса тот же, что и там: чем способнее становится модель или агент, которого вы внедряете, тем важнее заранее продумать, к чему у него есть доступ и кто это контролирует — а не полагаться, что новая версия «просто станет лучше и безопаснее сама по себе».
GeekOnAI