GPT‑6 Astra: дорогой агент или новый рабочий инструмент?

Что умеет GPT‑6 Astra, ускорит ли она разработку, сколько будет стоить и почему новая модель может увеличить количество AI-slop.

OpenAI представила GPT‑6 Astra — модель, которая должна не только отвечать на вопросы, но и самостоятельно выполнять длинные рабочие задачи. Разбираемся, где произошёл реальный скачок, сколько это будет стоить и почему более сильный ИИ не гарантирует более качественный результат.

Не спрашивайте, достигла ли Astra уровня AGI

После выхода GPT‑6 Astra руководители OpenAI и Nvidia заговорили о наступлении AGI — искусственного интеллекта, способного справляться с большинством экономически значимых задач не хуже человека.

Что умеет Astra — видео из фоициального аккаунте СhatGPT

Звучит громко. Но обычному пользователю важнее другое: Astra действительно может забрать часть работы или она просто станет ещё лучше писать тексты, которые потом всё равно придётся переделывать?

Короткий ответ: в некоторых сценариях — действительно может.

Главный скачок Astra связан не с тем, насколько красиво она отвечает в чате. Модель стала заметно лучше управлять компьютером, работать в браузере и доводить многоступенчатые задачи до результата.

Она может заполнить форму, обновить данные в CRM, собрать исследование, внести результат в документ, сделать сайт и затем проверить его интерфейс. То есть перед нами уже не только генератор ответа, а исполнитель, которому можно передать небольшой рабочий процесс.

Что умеет Astra

OpenAI перечисляет довольно широкий набор сценариев:

  • заполнять онлайн-формы;
  • обновлять клиентские записи в CRM;
  • организовывать календарь;
  • искать информацию в интернете;
  • готовить документы, таблицы и презентации;
  • устанавливать и тестировать программы;
  • создавать сайты и проводить frontend QA;
  • анализировать научные данные;
  • работать с большими кодовыми базами;
  • искать ошибки и выполнять миграции баз данных.

В тесте OSWorld, имитирующем работу с обычными компьютерными интерфейсами, Astra набрала 72,6% против 65,7% у GPT‑5.6 Sol. При этом задачу она выполняла примерно за 40 минут вместо 75 — почти на 47% быстрее. В обновлённом Codex отдельные компьютерные задачи выполняются приблизительно в 1,9 раза быстрее. Официальный анонс GPT‑6 Astra.

Разница выглядит не космической, если смотреть только на процент правильных ответов. Но почти двукратное сокращение времени уже способно изменить экономику использования AI-агентов.

Если агенту требуется полтора часа, чтобы выполнить задачу, его проще не запускать. Если он справляется за 30–40 минут и не требует постоянного надзора, его можно встроить в повседневный процесс.

Где произошёл настоящий скачок

Один из самых показательных результатов — AutomationBench, тест сложных профессиональных процессов.

Astra набрала 41,4%. GPT‑5.6 Sol — 18,1%.

Иначе говоря, новая модель справилась более чем вдвое лучше. Но здесь стоит обратить внимание и на вторую цифру: 41,4% — это всё ещё далеко не надёжность квалифицированного сотрудника.

Astra стала гораздо полезнее. Она не стала безошибочной.

С кодом картина ещё интереснее:

ТестGPT‑6 AstraGPT‑5.6 SolЧто это означает
Terminal-Bench 4.057,9%37,3%Заметный скачок в работе с терминалом и сложными техническими задачами
Database Migration Tasks63,9%42,7%Сильный прирост в миграциях баз данных
DeepSWE74,1%72,7%Улучшение минимальное
Coding Agent Index67,065,1Astra сильнее предшественника, но не лидер среди всех моделей

То есть утверждение «Astra полностью изменила разработку» пока слишком смелое.

В некоторых сложных агентных задачах прирост огромный. В других — несколько процентов. А на агрегированном Coding Agent Index конкурирующие модели всё ещё показывают сопоставимые или более высокие результаты.

Поэтому Astra, вероятно, сильнее всего ускорит не написание отдельной функции, а длинную цепочку: изучить репозиторий → найти нужные компоненты → внести изменения → запустить тесты → открыть приложение → проверить интерфейс → исправить ошибки → подготовить отчёт.

Длинная память важнее, чем кажется

Во время продолжительной работы AI-агенты регулярно упираются в ограничение контекста. Старую переписку приходится сжимать в краткое резюме, и часть деталей теряется: почему уже пробовали определённое решение, какой тест падал, какие требования нельзя нарушать.

Для Astra в Codex появилась другая механика. Модель может вести заметки между контекстными окнами и искать информацию в более ранних сообщениях и результатах работы.

Это не самая эффектная часть презентации. Но для больших проектов она может оказаться важнее очередного прироста на бенчмарке.

Если модель перестаёт каждые несколько часов забывать половину проекта, ей можно передавать рефакторинг, миграции и задачи, которые занимают не одну короткую сессию.

Что изменится в обычной работе

ЗадачаЧто сможет сделать AstraЧто проверяет человек
Исследование рынкаНайти источники, собрать данные, оформить выводыКачество источников и логику выводов
CRMОбновить записи, разнести данные, подготовить сегментыДоступы, правила сегментации, случайные изменения
ПрезентацияСобрать структуру и оформить слайды по шаблонуАргументацию, цифры и визуальную иерархию
СайтСоздать страницы, подключить функции, провести QAПродуктовое решение, безопасность и крайние сценарии
Кодовая базаНайти нужные файлы, изменить код, запустить тестыАрхитектуру, безопасность и последствия изменений
Поиск квартиры или работыПросмотреть варианты, сравнить и заполнить формыРешение, личные данные и отправку заявок
КонтентСобрать черновики и адаптировать материалыПозицию, факты, оригинальность и смысл

Больше всего выиграют люди, у которых уже есть понятный процесс и критерии качества.

Если редакция знает, как проверять источники и хороший ли текст получился, Astra ускорит производство. Если команда не умеет отличать сильный материал от правдоподобного мусора, она просто произведёт больше мусора.

Будет ли Astra слишком дорогой

В ChatGPT использование Astra включено в лимиты тарифов Plus, Pro, Business и Enterprise. Когда включённый объём закончится, можно будет покупать дополнительные кредиты.

В API стандартная цена составляет:

  • $10 за миллион входных токенов;
  • $50 за миллион выходных токенов;
  • Fast mode работает до двух раз быстрее, но стоит вдвое дороже.

Например, рабочая сессия, в которой агент прочитал 100 000 входных токенов и сгенерировал 30 000 выходных, обойдётся примерно в $2,50 без учёта кеша и других инструментов.

Но длинные агентные процессы потребляют не один запрос. Модель многократно перечитывает файлы, анализирует результаты инструментов, запускает тесты и исправляет собственные ошибки. Один серьёзный запуск может проглотить миллионы токенов.

Поэтому прогноз такой:

  • для личных задач Astra не будет казаться слишком дорогой, пока использование укладывается в подписку;
  • для редких сложных задач API-цена вполне оправданна;
  • массово запускать Astra на каждую кнопку, письмо и карточку товара будет экономически бессмысленно;
  • компании будут сочетать Astra с более дешёвыми моделями: дешёвая модель выполняет рутину, Astra подключается к сложным решениям и проблемным случаям.

Считать стоимость нужно не за запрос, а за успешно выполненную задачу.

Если запуск агента стоимостью $15 заменяет четыре часа разработчика, это дёшево. Если он создаёт черновик за $3, который специалист потом два часа переписывает, это дорого.


ИИ заберёт у людей работу или сделает их богаче? Разбор в нашем телеграм-канале — https://t.me/oh_my_prompt/325

Ускорит ли Astra разработку

Да. Особенно:

  • создание прототипов;
  • frontend-разработку;
  • миграции;
  • рефакторинг;
  • тестирование интерфейсов;
  • поиск ошибок в больших репозиториях;
  • внутренние инструменты;
  • небольшие продукты, где один человек совмещает несколько ролей.

Но ускорение разработки не означает пропорционального ускорения бизнеса.

Когда написать продукт становится легче, узким местом становятся другие вещи: выбор задачи, понимание аудитории, безопасность, распространение, поддержка и способность отличить полезную функцию от никому не нужной.

Кода станет больше. Хороших продуктов — не обязательно.

Astra даст буст или умножит AI-slop?

И то и другое.

Сильным специалистам Astra позволит быстрее пройти путь от идеи до проверенного результата. Разработчик сможет протестировать больше гипотез. Аналитик — глубже разобрать данные. Небольшая команда — собрать продукт, на который раньше потребовалось бы несколько месяцев.

Одновременно резко вырастет количество:

  • однотипных приложений;
  • плохо проверенного кода;
  • автоматически собранных сайтов;
  • SEO-страниц без новой информации;
  • презентаций, отчётов и исследований, которые выглядят убедительнее, чем заслуживают.

Раньше производство было ограничением: на слабый материал всё равно требовалось потратить время. Astra снижает эту цену.

Следовательно, ценность смещается от способности что-то произвести к способности решить, что вообще стоит производить, а затем проверить результат.

Промпт «сделай мне приложение» станет доступен всем. Хорошая постановка задачи, знание пользователей, система QA и ответственность за принятое решение — нет.

Проблема автономности

Astra стала первой моделью OpenAI, которой присвоен уровень Critical по кибервозможностям. По оценке компании, с нужными инструментами и доступами она способна самостоятельно находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации. Описание защитных мер и системная карта Astra.

При этом OpenAI сообщает, что модель лучше соблюдает границы задачи. В одном внутреннем тесте GPT‑5.6 Sol выходила за разрешённые пределы в 48% случаев, а Astra — в 0%.

Однако системная карта содержит менее комфортные результаты. В симуляциях Astra иногда использовала найденные учётные данные без отдельного разрешения, пыталась изменить защиту для продакшен-деплоя и выдавала автоматизированному процессу более широкие права, чем требовалось.

Кроме того, OpenAI признаёт: внутренние рассуждения Astra стало сложнее контролировать. В специальных тестах модель лучше предшественников скрывала намеренное ухудшение результатов от мониторов.

Это не означает, что Astra тайно строит собственные планы в обычном ChatGPT. Но означает, что модель такого уровня нельзя подключать ко всем документам, платежам, базам и продакшен-системам по принципу «пусть сама разберётся».

Разрешения должны быть минимальными. Необратимые действия — требовать подтверждения. Доступы — разделяться. Журнал действий — сохраняться.

Что смотреть на YouTube

Начать лучше с официальных демонстраций:

После этого можно посмотреть независимые примеры:

С независимыми роликами стоит соблюдать обычную осторожность: красивое видео показывает удачный запуск, но редко демонстрирует все неудачные попытки и стоимость итераций.

Прогноз на ближайшие 6–18 месяцев

Astra не заменит команды разработки целиком. Она уменьшит количество ручной работы внутри команды и поднимет планку ожидаемой скорости.

Один сильный специалист сможет делать больше. Но специалист без опыта не превратится автоматически в архитектора, исследователя или продуктового лидера. Он просто начнёт быстрее выпускать решения, качество которых не всегда способен оценить.

Наиболее вероятный сценарий:

  1. Astra станет старшим агентом для сложных задач.
  2. Более дешёвые модели возьмут на себя массовые операции.
  3. Люди сохранят контроль над доступами, архитектурой и финальными решениями.
  4. Компании начнут измерять не количество сгенерированного кода, а долю задач, завершённых без переделок и инцидентов.
  5. Количество AI-slop сначала резко вырастет.
  6. Затем рынки, поисковики и платформы начнут сильнее фильтровать однотипные продукты и контент.
  7. Человеческое суждение, доверие и способность выбрать правильную задачу станут дороже.

Что ещё почитать

Поделиться: