allnewscastallnewscast
Срочные новости
AI & Tech

Новости ИИ: Anthropic и OpenAI начали новую гонку по снижению стоимости моделей

Nic Reeve5 мин чтения
Новости ИИ: Anthropic и OpenAI начали новую гонку по снижению стоимости моделей

22 сентября 2026 года компании Anthropic и OpenAI представили более дешевые модели, обострив ценовую борьбу с бюджетными разработчиками ИИ и предоставив корпоративным клиентам новые альтернативы. Эти релизы стали центральным событием последних новостей из мира ИИ: Anthropic запустила Claude Opus 5.5, а OpenAI пополнила свою линейку моделями GPT-6 Sol и GPT-6 Luna.

Что выпустила Anthropic?

22 сентября 2026 года Anthropic представила Claude Opus 5.5, позиционируя её как менее дорогую опцию, которая может приближаться по производительности к её флагманской модели. Компания заявила, что система сопоставима с Claude Fable 5.1 в большинстве задач, в то время как в независимых отчетах основной акцент сделан на снижении стоимости токенов и сокращении операционных расходов.

  • Согласно Business Standard, 2026: стоимость Claude Opus 5.5 составляет $4 за миллион входных токенов и $20 за миллион выходных токенов.
  • Согласно англоязычному отчету The Korea Economic Daily, 2026: эти цены ниже, чем у Opus 5, где тарифы составляют $5 за входные и $25 за выходные токены.
  • Согласно заявлениям Anthropic, опубликованным Fortune, 2026: Opus 5.5 работает на уровне Fable 5.1 и обходится примерно на 40% дешевле в эксплуатации, чем Opus 5, при практическом использовании.

Ценовое различие Anthropic имеет значение, поскольку тариф за токен не отражает полную стоимость выполнения задачи ИИ. Модель, которая генерирует меньше ненужных токенов или более эффективно использует вычислительные ресурсы, может снизить итоговый счет клиента, даже если основная цена API говорит лишь о части картины.

Как ответила OpenAI?

OpenAI объявила о выпуске GPT-6 Sol и GPT-6 Luna спустя всего несколько часов после релиза Anthropic. Эти две системы нацелены на разные типы нагрузки. Sol ориентирована на более сложные задачи, такие как программирование, в то время как Luna предназначена для высокообъемных работ, включая суммаризацию документов и извлечение информации.

  • Согласно CNBC, 2026: OpenAI снизила цены на API для GPT-6 Sol и GPT-6 Luna на 50% по сравнению с промо-ценами на GPT-5.6.
  • Согласно заявлению OpenAI, цитируемому Tech.co, 2026: улучшения в кэшировании и инференсе (выводе) позволили компании предоставлять модели по более низкой цене.
  • Согласно CNBC, 2026: в линейке компании GPT-6 Sol занимает позицию ниже модели GPT-6 Astra.

Такое разделение отражает практические изменения в том, как провайдеры упаковывают продвинутые системы. Вместо того чтобы предлагать одну премиальную модель для любой задачи, компании создают уровни для программирования, рассуждений, извлечения данных, суммаризации и других рабочих нагрузок с различными требованиями к стоимости и скорости.

Почему новые модели дешевле?

Компании указывают на повышение эффективности, а не на простое снижение возможностей. Anthropic заявила, что Opus 5.5 эффективнее использует вычислительные ресурсы и выдает менее многословные ответы. OpenAI объяснила снижение цен улучшениями в кэшировании и инференсе, которые влияют на объем вычислительной мощности, необходимый при отправке запроса клиентом.

  • Согласно National Technology, 2026: Anthropic установила цену на Opus 5.5 на 20% ниже, чем на Opus 5, в расчете на один токен.
  • Согласно National Technology, 2026: Anthropic утверждает, что фактические эксплуатационные расходы снижаются примерно на 40% благодаря росту эффективности и уменьшению объема выходных данных.
  • Согласно англоязычному отчету The Korea Economic Daily, 2026: по данным Anthropic, Opus 5.5 набрала более высокие баллы, чем Fable 5.1, в некоторых бенчмарках по программированию и интеллектуальной деятельности.

Эти цифры основаны на заявлениях компаний и не должны рассматриваться как универсальное сравнение цен. Итоговые расходы зависят от длины промпта, длины ответа, кэширования, объема использования, требований к задержке (latency) и того, как именно клиент интегрирует модель в свое программное обеспечение.

На кого повлияло снижение цен?

Больше всего выгоды в краткосрочной перспективе получат предприятия, обрабатывающие большие объемы текста или кода. Снижение стоимости инференса может изменить экономику агентов клиентской службы, инструментов поиска, помощников по программированию, систем документооборота и внутренних приложений для управления знаниями. Разработчики также получают больше свободы, делегируя рутинную работу более дешевым моделям и резервируя премиальные системы для сложных запросов.

  • Пользователи с большими объемами данных могут извлечь выгоду из специализации Luna на извлечении и суммаризации, сообщает CNBC, 2026.
  • Команды разработчиков ПО могут оценивать GPT-6 Sol и Opus 5.5 в сравнении с более дорогими передовыми моделями, основываясь на описаниях продуктов от CNBC и Business Standard, 2026.
  • Клиентам, выбирающим между провайдерами, необходимо оценивать полную стоимость задачи, а не только цены API, поскольку эффективность и длина ответа влияют на итоговый счет.

Более дешевый доступ также может стимулировать эксперименты. Стартап, который раньше не мог оправдать частое использование премиальной модели, теперь может протестировать автоматизированные рабочие процессы, если модель соответствует его требованиям к точности, конфиденциальности и надежности.

Является ли это ответом на появление более дешевых конкурентов?

Да. Репортажи CNBC, NDTV и других изданий связывают эти релизы с растущим давлением со стороны более дешевых моделей и моделей с открытыми весами, особенно из Китая и других рынков, чувствительных к цене. Конкурентный вопрос теперь заключается не только в том, какая модель работает лучше всех, но и в том, какой провайдер может обеспечить приемлемые результаты по цене, позволяющей масштабное внедрение.

Системы с открытыми весами создают иное давление, поскольку клиенты могут запускать их на собственной инфраструктуре или через конкурирующие хостинговые сервисы. Закрытые провайдеры, такие как Anthropic и OpenAI, сохраняют преимущества в доступе к моделям, управляемой инфраструктуре и интегрированным инструментам, но покупатели, чувствительные к цене, теперь могут сравнивать больше вариантов, чем раньше.

Что дальше?

Anthropic заявила, что планирует выпустить Sonnet 5.5 и Haiku 5.5 в ближайшие недели. Это запланированное расширение предоставит клиентам дополнительные варианты как ниже, так и наряду с Opus 5.5. Выпуск GPT-6 Sol и Luna от OpenAI также указывает на то, что компания выстраивает более широкий спектр моделей вокруг своей платформы GPT-6.

  • Согласно Fortune, 2026: Anthropic ожидает появления Sonnet 5.5 и Haiku 5.5 в течение следующих недель.
  • Согласно The Peninsula, 2026: релизы состоялись спустя всего несколько дней после того, как официальные лица обеих компаний призвали к замедлению темпов разработки ИИ.
  • Согласно TechXplore, 2026: запуск более дешевых моделей произошел на фоне продолжающейся обеспокоенности безопасностью стремительно развивающихся систем ИИ.

Такое совпадение создает явное противоречие. Руководители компаний могут призывать к осторожности в разработке передовых технологий, в то время как их бизнес продолжает выпускать модели, предназначенные для захвата новых сегментов рынка. Для клиентов непосредственным результатом станет расширение выбора систем с различными компромиссами между ценой, возможностями, скоростью и мерами безопасности.

Источники

  1. 1.cnbc.com
  2. 2.thepeninsulaqatar.com
  3. 3.business-standard.com
  4. 4.en.sedaily.com
  5. 5.ua.news
  6. 6.techxplore.com
  7. 7.news.abs-cbn.com
  8. 8.chosun.com
  9. 9.fortune.com
  10. 10.nationaltechnology.co.uk
  11. 11.ndtv.com
  12. 12.tekedia.com
  13. 13.inc42.com
  14. 14.tech.co
  15. 15.siliconangle.com

Читать далее →

Похожие материалы

GPT-5.6 и ChatGPT от OpenAI знаменуют новую эру в развитии AI-супераппов
AI & Tech

GPT-5.6 и ChatGPT от OpenAI знаменуют новую эру в развитии AI-супераппов

OpenAI представила GPT-5.6 вместе с переработанным унифицированным настольным решением под названием ChatGPT Work , что стало одним из крупнейших шагов в сторону создания «ИИ-суперприложения», способного планировать, создавать и выполнять сложные цифровые задачи с использованием различных инструментов и устройств. В то же время этот запуск оказывает значительное влияние на всю технологическую экосистему и сферу продуктивности: разработчики, предприятия и рядовые пользователи пересматривают свои подходы к организации работы с использованием всё более автономных ИИ-агентов. GPT-5.6: новое семейство передовых моделей GPT-5.6 — это новейшее семейство передовых моделей OpenAI, которое теперь доступно в ChatGPT, Codex, новом приложении ChatGPT Work и через API OpenAI. Релиз переводит модель из стадии ограниченного тестирования в формат общедоступного продукта, открывая доступ разработчикам и компаниям по всему миру. OpenAI и первые тестировщики отмечают, что GPT-5.6 значительно превосходит своих предшественников в многошаговых рассуждениях, сложных задачах программирования и долгосрочных проектах. Семейство моделей организовано в три основных варианта: Sol — флагманская, самая мощная модель для наиболее требовательных задач, связанных с аналитикой и созданием контента. Terra — сбалансированный и экономически эффективный вариант для повседневных рабочих нагрузок. Luna — более доступная модель, оптимизированная для масштабирования и высоконагруженных сценариев использования. Первые технические обзоры показывают, что Sol, представленная в конце июня и полностью выпущенная в июле, демонстрирует заметные успехи в создании комплексных приложений, включая веб-сервисы и внутренние бизнес-инструменты, требуя при этом меньше итераций и точнее следуя спецификациям. Тестировщики сообщают, что модель теперь способна управлять всей структурой проекта — от планирования схем данных и API до генерации интерфейсных компонентов, сохраняя при этом согласованность между файлами. ChatGPT Work: новое суперприложение для продуктивности Наряду с GPT-5.6 компания OpenAI представила ChatGPT Work — единое настольное «суперприложение», призванное стать универсальной точкой входа для офисной продуктивности. Вместо того чтобы быть просто интерфейсом чата, ChatGPT Work действует как ИИ-агент, способный непрерывно выполнять задачи, координируя рабочие процессы между локальными файлами, облачными хранилищами, инструментами коммуникации и браузерами. Приложение объединяет ранее разрозненные решения — стандартный ChatGPT, помощник по программированию Codex и экспериментальный браузер Atlas — в один переработанный интерфейс для компьютера, веба и мобильных устройств. В этой среде ChatGPT Work может: Подключаться к рабочим инструментам, таким как электронная почта, календари, мессенджеры, облачные диски и CRM, с помощью плагинов или встроенных интеграций. Собирать контекст из этих источников для понимания текущих проектов, сроков и доступных материалов. Создавать готовые результаты: от документов и электронных таблиц до презентаций, веб-сайтов и внутренних инструментов. Выполнять долгосрочные рабочие процессы в фоновом режиме, разбивая глобальные цели на многошаговые планы и уведомляя пользователя по мере достижения контрольных точек. OpenAI позиционирует ChatGPT Work как агента, работающего как локально, так и в облаке. На компьютере приложение может читать и упорядочивать локальные файлы, редактировать документы и взаимодействовать с другим установленным ПО. В облаке оно координирует действия между подключенными сервисами, позволяя выстраивать рабочие процессы, охватывающие несколько команд и систем. Закрытие Atlas и консолидация экосистемы Стремление к созданию суперприложения побудило OpenAI упростить линейку продуктов. Компания подтвердила, что ChatGPT Atlas , её отдельный настольный ИИ-браузер, запущенный в 2025 году, прекращает свою работу. Функции браузера по агентной навигации в интернете и накопленный опыт использования данных переносятся в унифицированное настольное приложение ChatGPT, включая новый функционал браузера внутри приложения и интеграции, такие как боковая панель в Chrome. Объединяя Chat, Work и Codex в единое настольное решение, OpenAI стремится снизить фрагментацию и предложить пользователям единый центр для общения с ИИ, помощи в программировании и выполнения агентных задач. Отраслевые эксперты видят в этом часть более широкого тренда: ИИ-компании стремятся стать основным интерфейсом для цифровой работы, а не просто одним инструментом из многих. Стратегия доступа и развертывания Развертывание GPT-5.6 и ChatGPT Work происходит поэтапно в зависимости от тарифных планов OpenAI. Единое настольное приложение для Mac и Windows доступно немедленно, в том числе для бесплатных пользователей, которые обычно получают доступ к более оптимизированному по стоимости варианту модели. Более высокие тарифы, такие как Pro, Enterprise и Edu, получают приоритетный доступ ко всем возможностям GPT-5.6 — особенно к вариантам Sol и Terra — наряду с расширенными функциями в ChatGPT Work. Пользователи тарифов Plus и Business получают доступ к функциям в течение нескольких дней. Среди ключевых преимуществ для профессионального использования выделяются совместная работа нескольких агентов, программный вызов инструментов через API Responses и хостинг «Сайтов» для быстрой публикации веб-контента. Компания позиционирует это как эволюцию от изолированных чат-сессий к постоянному ИИ-сотрудничеству на уровне проектов. Рыночные последствия и конкуренция Время и масштаб запуска имеют явные конкурентные последствия. ChatGPT Work, работающий на базе GPT-5.6, прямо противопоставляется решениям для рабочих пространств от конкурирующих ИИ-компаний, включая агентные инструменты для управления документами, базами знаний и проектными задачами. Аналитики отмечают, что, объединяя функции программирования, браузера и продуктивности в одном приложении, OpenAI пытается закрепить рабочие процессы пользователей в своей экосистеме в преддверии возможного выхода на биржу. Некоторые комментаторы сравнивают этот шаг с предыдущими технологическими сдвигами, такими как появление интегрированных офисных пакетов и операционных систем для смартфонов, которые объединили общение, продуктивность и мультимедиа в единую среду. В случае успеха стратегия суперприложения может сделать ИИ-агентов не отдельными сервисами, а базовым операционным слоем для интеллектуальной работы. Первые отзывы разработчиков и опытных пользователей Первичные отзывы разработчиков сосредоточены на производительности GPT-5.6 Sol в реальных сценариях программирования. Ранние пользователи сообщают, что за несколько дней создали несколько функциональных приложений — например, внутренние панели мониторинга, клиентские порталы и скрипты автоматизации, — при этом модель взяла на себя больше «связующей» работы между сервисами и фреймворками, чем предыдущие поколения. Опытные пользователи, занимающиеся операционной деятельностью, отмечают потенциал интерфейса «центра управления» в ChatGPT Work: он позволяет ставить цели и отслеживать прогресс по мере выполнения задач агентом, а не постоянно давать разовые команды. Тем не менее остаются вопросы относительно управления, возможности аудита и глубины интеграции в сложных корпоративных средах, где требования соответствия и хранения данных могут замедлить внедрение. От новостей об ИИ к повседневным рабочим процессам Стремительная эволюция от моделей класса GPT-4 к GPT-5.6 и полностью объединенному суперприложению подчеркивает, как быстро ИИ переходит из разряда новинок в инфраструктуру. В еженедельных обзорах новостей ИИ комментаторы подчеркивают: суть уже не столько в «сухих» тестах производительности моделей, сколько в том, как эти системы упаковываются в инструменты, меняющие повседневную рутину — от разработки ПО и финансового анализа до маркетинга, исследований и административной координации. Последний релиз OpenAI предполагает, что следующий этап конкуренции будет сосредоточен на том, кто сможет предоставить наиболее мощное, надежное и бесшовное агентное рабочее пространство. GPT-5.6 и ChatGPT Work созданы как комплексный ответ на этот вызов: новая линейка моделей в сочетании с операционной средой, где ИИ может не только отвечать на вопросы, но и реализовывать проекты в цифровом ландшафте, в котором сегодня происходит любая работа.

Nic Reeve·
AI-новости: Claude от Anthropic получит четверть ресурсов на разработку своего преемника
AI & Tech

AI-новости: Claude от Anthropic получит четверть ресурсов на разработку своего преемника

AInews: Claude от Anthropic берет на себя четверть задач по созданию своего преемника 17 сентября 2026 года компания Anthropic сообщила, что ее чат-бот Claude теперь выполняет 26% всех научно-исследовательских и опытно-конструкторских работ (НИОКР) компании по созданию будущих моделей ИИ. Эта веха была представлена фирмой как ранний пример того, как системы искусственного интеллекта, согласно AInews, начинают помогать в создании своих собственных преемников под строгим человеческим контролем. Какой объем работ по НИОКР в Anthropic теперь выполняет Claude? Anthropic сообщает, что по состоянию на август 2026 года Claude «руководит» 26% внутренних исследований и разработок моделей, тогда как в марте 2026 года этот показатель составлял около 1%. Это означает, что система способна выполнять большую часть задачи на основе высокоуровневого запроса, в то время как люди контролируют и одобряют каждый шаг. Anthropic подробно описала рабочую нагрузку Claude, используя шкалу автономности, разработанную Epoch AI — независимой некоммерческой организацией, отслеживающей прогресс в области систем искусственного интеллекта. Компания и сторонние аналитики представили следующие цифры и временную шкалу: Согласно посту в блоге Anthropic от 17 сентября 2026 года: Claude руководил 26% работ по НИОКР моделей по состоянию на август 2026 года. По данным Reuters, измерения в марте 2026 года показывали, что Claude руководил примерно 1% такой работы по той же шкале. Методология Epoch AI классифицирует текущий уровень как AL4, «руководство» (leads) , когда ИИ может выполнять большую часть задачи от начала до конца на основе высокоуровневого запроса при постоянном надзоре человека. Anthropic сообщила журналистам, что вклад Claude вырос с менее чем 1% в феврале до примерно четверти измеряемой работы к августу 2026 года. Технический обозреватель The Washington Post описал эту 26-процентную долю как «более четверти» всех НИОКР Anthropic, подчеркнув, как быстро компания передала основные инженерные задачи в руки своего собственного чат-бота. Является ли Claude полностью автономным при создании своей следующей версии? Anthropic утверждает, что Claude еще не является полностью автономным, подчеркивая, что люди по-прежнему остаются «в контуре управления» (in the loop) и что ни одна часть измеряемой работы не достигла наивысшего уровня автономности, при котором система ИИ могла бы полностью проектировать, обучать и одобрять своего преемника без надзора человека. В своих публичных метриках Anthropic провела четкую грань между сотрудничеством и автономностью. Компания и сторонние эксперты сообщают следующее: Согласно блогу Anthropic и сообщениям Reuters, по состоянию на август 2026 года 0% измеряемой работы достигли уровня AL5 «полная автономность» . Anthropic заявила, что Claude «не работает полностью автономно ни в какой части измеряемой работы» и что люди контролируют, проверяют и могут блокировать его действия. Согласно техническому резюме, Claude в настоящее время пишет инфраструктурный код, проводит эксперименты, анализирует результаты и проверяет изменения, но он не устанавливает корпоративные цели, не принимает решения о политике развертывания и не контролирует процесс обучения в целом. Опубликованная Anthropic шкала автономности, адаптированная от Epoch AI, различает ИИ, который помогает , сотрудничает , руководит и, наконец, действует автономно ; Claude находится на предпоследней ступени. Издания, включая ABC News и The Washington Post, подчеркивают, что, несмотря на заголовки об ИИ, который «строит сам себя», Claude по-прежнему зависит от исследователей-людей в вопросах направления, ограничений и окончательного утверждения на каждом этапе. Какого рода работу выполняет Claude для создания своего преемника? Claude теперь выполняет широкий спектр технических задач в цикле исследований моделей Anthropic, включая написание и исправление кода, проектирование экспериментов, запуск задач по обучению и оценке, а также помощь в интерпретации результатов, которые используются при проектировании будущих версий Claude. Данные Anthropic вместе с анализом технологических изданий описывают роль Claude конкретными инженерными терминами: Согласно метрикам Anthropic за сентябрь 2026 года, Claude все чаще пишет инфраструктурный код , используемый для обучения и оценки новых моделей, под контролем человека. Компания заявляет, что Claude теперь помогает проектировать эксперименты , настраивать запуски на вычислительных кластерах и корректировать параметры, основываясь на высокоуровневых целях, поставленных исследователями-людьми. Отчеты профильных технологических сайтов говорят о том, что Claude теперь анализирует результаты экспериментов , предлагая изменения в архитектурах, функциях потерь или выборе данных, которые люди могут принять или отклонить. Anthropic сообщила журналистам, что более 90% ее работ по НИОКР теперь включают системы ИИ, сотрудничающие с людьми на уровне «ИИ сотрудничает» или выше по шкале автономности. По данным ABC News и The Washington Post, компания характеризует этот вклад как «большие объемы работы», выполняемые под «тесным руководством человека», а не как независимое принятие решений. Внешние комментаторы характеризуют роль Claude как переход от простого дополнения кода или генерации документации к помощи в структурировании целых исследовательских проектов, даже если исследователи по-прежнему выбирают цели и проверяют каждый шаг. Почему Anthropic опубликовала метрики автономности и кто создал эту шкалу? Anthropic опубликовала подробные измерения роли Claude, чтобы дать политикам, исследователям и общественности более четкое представление о том, насколько быстро системы ИИ вносят вклад в разработку ИИ, используя пятиуровневую шкалу автономности, разработанную при участии Epoch AI — независимой некоммерческой организации, отслеживающей развитие технологий. В посте в блоге Anthropic от 17 сентября 2026 года поясняется, что лаборатория планирует регулярно публиковать такие данные, чтобы внешние наблюдатели могли оценить прогресс на пути к системам, которые однажды смогут создавать более совершенный ИИ с ограниченным участием человека. Это объявление и освещение в финансовых и технологических изданиях подчеркивают несколько аспектов такого подхода: По данным Finimize, Anthropic заявила, что будет «продолжать публиковать статистику» того, как быстро ИИ начинает создавать ИИ, используя шкалу автономности в качестве общего мерила. Reuters сообщил, что Anthropic рассматривает эти цифры как ранние индикаторы прогресса на пути к «рекурсивному самосовершенствованию» — сценарию, при котором ИИ улучшает себя сам, не полагаясь на инженеров-людей при каждой итерации. Шкала автономности Epoch AI, цитируемая Anthropic и множеством других изданий, определяет уровни от AL1 (ИИ помогает человеку в узких задачах) до AL5 (ИИ действует автономно на всем этапе разработки). Внутренние измерения Anthropic относят большую часть работы Claude к уровням AL3 («сотрудничает») и AL4 («руководит»), при этом по состоянию на август 2026 года ни одна задача не достигла уровня AL5. Институт безопасности и систем ИИ при Anthropic опубликовал исследовательскую заметку под названием «Когда ИИ строит сам себя», описывающую, как при наличии достаточных вычислительных мощностей автономность может распространиться на проектирование, обучение и развертывание систем-преемников. Руководители Anthropic в публичных интервью утверждали, что такая прозрачность может помочь регуляторам отслеживать риски по мере того, как системы ИИ берут на себя все больше работы по созданию нового ИИ, вместо того чтобы оставлять прогресс видимым только внутри корпоративных лабораторий. Как стремление Claude к самосовершенствованию вписывается в общую повестку Anthropic по безопасности? Anthropic представляет растущую роль Claude в разработке моделей одновременно как повышение эффективности и как тестовый случай для мер безопасности. Эти меры призваны сохранить контроль человека над системами ИИ, помогающими создавать более способных преемников, включая строгий надзор, ограничения действий и возможность приостановить обучение при росте рисков. На протяжении большей части 2026 года Anthropic публично предупреждала о рисках стремительного развития ИИ, одновременно продвигая собственные модели вперед. Ранее в этом году компания призвала ведущие лаборатории координировать возможные паузы в разработке, если показатели безопасности укажут на рост опасности: 4 июня 2026 года Reuters сообщил, что Anthropic призвала к «скоординированному плану» среди крупнейших разработчиков ИИ для остановки разработок, если риски превысят согласованные пороги, ссылаясь на растущие возможности в выполнении задач и самосовершенствовании систем. Согласно этому отчету, Anthropic заявила, что способность ИИ самостоятельно выполнять сложные задачи удваивается примерно каждые четыре месяца, что указывает на возможность рекурсивного самосовершенствования. В своей исследовательской заметке «Когда ИИ строит сам себя» от 18 сентября 2026 года Институт Anthropic изложил сценарии, при которых будущие системы могут автономно проектировать и обучать преемников, подчеркнув необходимость управления и технических средств контроля до появления таких систем. Текущие данные подчеркивают, что Claude не выбирает корпоративные цели, не может самостоятельно одобрить свое развертывание и работает под защитными механизмами, которые позволяют персоналу приостановить или отменить действия. Освещение в общественно-политических СМИ отражает это двойственное послание: Anthropic стремится использовать ИИ для создания лучшего ИИ, одновременно публично настаивая на том, что защитные барьеры и возможность приостановки должны идти в ногу с техническим прогрессом. На кого влияет расширенная роль Claude и что может быть дальше? Расширенная роль Claude в НИОКР Anthropic затрагивает инженеров внутри компании, конкурирующие лаборатории ИИ, наблюдающие за экспериментом, регуляторов, отслеживающих автоматизацию критически важных систем, и инвесторов, оценивающих экономику исследований под управлением ИИ. При этом Anthropic сигнализирует, что ожидает дальнейшего роста доли ИИ в разработке в ближайшие месяцы. Репортажи финансовых и технологических изданий намечают краткосрочные последствия: Согласно Finimize и Reuters, показатели Anthropic демонстрируют, что системы ИИ берут на себя растущую долю дорогостоящих исследовательских работ, что в среднесрочной перспективе может снизить затраты на обучение и эксперименты с крупными моделями. Статьи в технологической журналистике отмечают, что конкурирующие лаборатории, такие как OpenAI и Google DeepMind, уже используют инструменты ИИ внутри своих компаний и могут столкнуться с давлением с целью публикации сопоставимых метрик того, какая часть их собственной работы теперь управляется ИИ. Политические аналитики, цитируемые в публикациях, говорят, что регулярная отчетность об уровнях автономности может повлиять на регуляторные предложения по прозрачности, аудиту и требованиям присутствия человека в контуре управления при разработке передового ИИ. Собственный Институт Anthropic предполагает, что если автономность продолжит расти, будущие обновления могут показать системы ИИ, которые не только проектируют эксперименты, но и предлагают новые архитектуры, конвейеры обучения и стратегии безопасности в масштабе всей компании. Внешние эксперты предупреждают, что как только системы ИИ смогут полностью проектировать и обучать преемников с ограниченным участием человека, вопросы подотчетности, ответственности и контроля станут гораздо острее, чем в сегодняшних условиях контролируемого процесса. Anthropic не дала точного прогноза относительно того, когда Claude или его преемники могут достичь высшего уровня автономности. Вместо этого компания обязалась регулярно публиковать метрики работ под руководством ИИ и сотрудничать с некоммерческими организациями, такими как Epoch AI, чтобы совершенствовать методы измерения того, насколько близки системы ИИ к созданию следующего поколения самих себя.

Nic Reeve·
Не только запуск моделей: метрики, отражающие реальные темпы развития передового ИИ
AI & Tech

Не только запуск моделей: метрики, отражающие реальные темпы развития передового ИИ

Согласно недавним исследованиям и репортажам, передовые лаборатории развиваются слишком быстро, чтобы темпы прогресса в области ИИ можно было объяснить одним лишь показателем или датой релиза. Наиболее полная картина складывается из сочетания частоты выпусков, прироста в бенчмарках, длительности выполнения задач, вычислительных ресурсов, надежности и результатов тестирования безопасности. Эта проблема комплексного измерения теперь занимает центральное место в новостях об ИИ , поскольку компании переходят от эпизодических запусков моделей к непрерывному совершенствованию. Что случилось с циклом релизов? В 2026 году запуски моделей стали более частыми, но одни лишь анонсы продуктов не могут показать, насколько улучшилась система. Релиз может означать новую модель, настроенный вариант, обновление безопасности или более дешевую версию. Подсчет количества релизов по-прежнему полезен, но только в сочетании с последовательными тестами и датами. По данным The Register от 23 сентября 2026 года, частота релизов Anthropic ускорилась: с примерно ежеквартальных запусков в 2025 году до почти ежемесячных в 2026 году. Согласно отчету Tech Insider от 5 сентября 2026 года, четыре передовые лаборатории выпустили крупные модели в течение 72-часового периода в начале сентября. Согласно тому же отчету, крупные обновления, которые в начале 2026 года выходили один или два раза в квартал, все чаще появляются ежемесячно или даже чаще. Ускорение цикла может свидетельствовать о более мощном инженерном и операционном потенциале. Однако это также может отражать выпуск мелких обновлений, изменение упаковки продукта или параллельных версий, а не сопоставимый скачок в общих возможностях. Поэтому исследователям необходимы журналы релизов, фиксирующие размер модели, назначение, дату оценки и то, является ли система предварительной версией (preview) или полноценным продуктом (production). Какие бенчмарки показывают реальный прогресс? Бенчмарки возможностей остаются самым четким способом сравнения систем, однако тесты теряют ценность, когда передовые модели достигают «потолка». Полезная система измерения должна отслеживать как сам балл, так и оставшийся запас возможностей (headroom). Она также должна включать незнакомые задачи, поскольку высокая производительность в одном бенчмарке не гарантирует надежной работы в других областях. Согласно AI Index Стэнфордского университета за 2026 год, опубликованному в сентябре 2026 года, почти все ведущие разработчики передовых моделей сообщают о результатах своих возможностей, в то время как отчеты по бенчмаркам ответственного ИИ остаются непоследовательными. Согласно данным AI Index Стэнфорда, упомянутым в недавних репортажах, производительность на SWE-bench Verified выросла с примерно 60% до почти 100% за один год. Согласно отчету Стэнфорда, количество задокументированных инцидентов с ИИ достигло 362 по сравнению с 233 в 2024 году. Предыдущая цифра является историческим фоном, а не подсчетом за текущий год. Насыщение бенчмарков создает практическую проблему. Тест, разработанный так, чтобы оставаться сложным в течение нескольких лет, может стать легким уже через месяцы. Следующее поколение оценок должно измерять исследовательскую деятельность с открытым финалом, написание программного обеспечения, научные рассуждения, фактическую точность и устойчивость к манипуляциям в условиях, приближенных к реальному использованию. Почему длительность задачи становится ключевым показателем? Длительность задачи измеряет, как долго модель может успешно работать, прежде чем вероятность ошибок возрастет. Вместо того чтобы спрашивать, правильно ли модель отвечает на один вопрос, эксперты проверяют, может ли она выполнить многоэтапную работу, которую квалифицированный человек обычно выполняет в течение определенного периода времени. Этот показатель фиксирует уровень автономности более прямо, чем единый балл точности. В недавних исследованиях передовых моделей использовалась оценка «горизонта задач» (task-horizon), при которой исследователи оценивают время, затрачиваемое человеком на задачи, и определяют точку, в которой модель справляется примерно в половине случаев. Такой подход позволяет отличить систему, решающую пятиминутные задачи по программированию, от системы, способной справиться с многочасовым инженерным заданием. Согласно анализу Big Matrix от 11 сентября 2026 года, METR в течение примерно 100 дней в 2026 году оценил несколько передовых релизов, включая Claude Opus 4.6, GPT-5.4 и Gemini 3.1 Pro. Согласно тому же анализу, тестирование горизонта задач измеряет эквивалентную человеческую продолжительность работы до того, как успех модели упадет до 50%. Этот показатель все еще не является исчерпывающим. Длительные задачи могут скрывать ошибки, а модель может выдавать убедительный, но неверный результат. Оценщикам необходимо фиксировать время на исправление ошибок, использование инструментов, необходимость контроля и стоимость повторных попыток. Как вычислительные мощности раскрывают темпы работы лабораторий? Вычислительные ресурсы для обучения дают физическое представление о том, сколько ресурсов лаборатория вкладывает в новые системы. Исследователи могут сравнивать часы работы процессоров, поколения ускорителей, энергопотребление, объем данных и мощность инференса (вывода). Вычисления не равны возможностям, но они помогают объяснить, почему разработка может ускоряться, даже если публичные релизы кажутся схожими. Данные об обучении часто являются конфиденциальными, и лаборатории раскрывают их неравномерно. Это затрудняет публичные сравнения. Независимые аналитики все же могут отслеживать строительство дата-центров, закупки чипов, облачные контракты и мощности для обслуживания моделей, но эти показатели требуют тщательной атрибуции, так как один объект может поддерживать несколько продуктов. Согласно AI Index Стэнфорда за 2026 год, более 90% заметных передовых моделей были разработаны коммерческим сектором, что показывает: ведущие данные измерений все чаще поступают от компаний, а не от университетов. Согласно результатам бенчмарков в отчете, прирост возможностей происходит быстрее, чем системы оценки, предназначенные для их измерения. По этой причине надежный индикатор темпов должен сочетать раскрытые вычислительные мощности с полученным улучшением на единицу этих мощностей. Лаборатория, которая удваивает свое оборудование, но почти не получает прогресса в сложных независимых тестах, может масштабироваться неэффективно. Лаборатория, достигающая больших успехов при аналогичных ресурсах, вероятно, улучшила данные, алгоритмы или методы обучения. Что добавляют безопасность и надежность? Результаты тестирования безопасности показывают, сопровождается ли рост возможностей контролем. Модель, которая набирает больше баллов в программировании или рассуждениях, но становится менее правдивой, более уязвимой для эксплуатации или более трудной для мониторинга, не является безусловным улучшением. Поэтому оценки безопасности должны публиковаться вместе с результатами оценки возможностей, а не рассматриваться как отдельный PR-ход. AI Index Стэнфорда за 2026 год выявил разрыв между повсеместными отчетами по бенчмаркам возможностей и менее последовательными отчетами по тестам ответственного ИИ. Этот разрыв ограничивает возможности сравнения лабораторий. Публичные оценочные карты должны включать показатели галлюцинаций, тестирование на киберзлоупотребления, утечку конфиденциальности, меры предвзятости, точность отказов и производительность при состязательных промптах (adversarial prompting). Согласно отчету Стэнфорда за сентябрь 2026 года, отчетность по бенчмаркам ответственного ИИ среди ведущих разработчиков остается фрагментарной. Согласно данным Стэнфорда по количеству инцидентов, в последнем наборе данных отчета зафиксировано 362 документально подтвержденных инцидента по сравнению с 233 в 2024 году. Количество инцидентов не является прямым показателем возможностей модели. Оно лишь показывает, какой ущерб наблюдается и фиксируется в связи с развернутыми системами. Исследователи должны отделять сбои моделей от сбоев, вызванных развертыванием, поведением пользователей или слабыми мерами защиты. Что должна содержать практическая оценочная карта передовых моделей? Полезная оценочная карта (scorecard) должна отслеживать одни и те же системы во времени и публиковать достаточно деталей для независимой проверки. Частота релизов дает понимание скорости. Бенчмарки показывают производительность в задачах. Горизонт задач показывает автономность. Вычисления показывают объем инвестиций. Тесты безопасности обеспечивают контроль. Стоимость и надежность показывают, выживают ли результаты лаборатории при контакте с реальными пользователями. Интервал релизов: количество дней между сопоставимыми версиями моделей, с отдельной идентификацией предварительных и производственных систем. Прирост возможностей: изменение показателей в сложных, устойчивых к «загрязнению» (contamination-resistant) тестах, с указанием даты оценки и версии теста. Горизонт задач: максимально длительное задание, эквивалентное человеческому, выполненное с заданной вероятностью успеха. Эффективность: прирост возможностей на единицу вычислительной мощности при обучении и на доллар при инференсе. Надежность: частота ошибок, фактическая точность, сбои инструментов и объем необходимой человеческой корректировки. Безопасность: тесты на вредоносные возможности, результаты конфиденциальности, кибер-оценки, точность отказов и задокументированные инциденты. Развитие передовых технологий — это не одна гонка, измеряемая одними часами. Наиболее обоснованными будут сравнения, сочетающие публичные записи о релизах с независимыми оценками и четко датированными раскрытиями лабораторий. Такой подход позволит понять, является ли новая система действительно более способной, просто более доступной или же она просто лучше упакована для развертывания.

Nic Reeve·