Не только запуск моделей: метрики, отражающие реальные темпы развития передового ИИ

Согласно недавним исследованиям и репортажам, передовые лаборатории развиваются слишком быстро, чтобы темпы прогресса в области ИИ можно было объяснить одним лишь показателем или датой релиза. Наиболее полная картина складывается из сочетания частоты выпусков, прироста в бенчмарках, длительности выполнения задач, вычислительных ресурсов, надежности и результатов тестирования безопасности. Эта проблема комплексного измерения теперь занимает центральное место в новостях об ИИ, поскольку компании переходят от эпизодических запусков моделей к непрерывному совершенствованию.
Что случилось с циклом релизов?
В 2026 году запуски моделей стали более частыми, но одни лишь анонсы продуктов не могут показать, насколько улучшилась система. Релиз может означать новую модель, настроенный вариант, обновление безопасности или более дешевую версию. Подсчет количества релизов по-прежнему полезен, но только в сочетании с последовательными тестами и датами.
- По данным The Register от 23 сентября 2026 года, частота релизов Anthropic ускорилась: с примерно ежеквартальных запусков в 2025 году до почти ежемесячных в 2026 году.
- Согласно отчету Tech Insider от 5 сентября 2026 года, четыре передовые лаборатории выпустили крупные модели в течение 72-часового периода в начале сентября.
- Согласно тому же отчету, крупные обновления, которые в начале 2026 года выходили один или два раза в квартал, все чаще появляются ежемесячно или даже чаще.
Ускорение цикла может свидетельствовать о более мощном инженерном и операционном потенциале. Однако это также может отражать выпуск мелких обновлений, изменение упаковки продукта или параллельных версий, а не сопоставимый скачок в общих возможностях. Поэтому исследователям необходимы журналы релизов, фиксирующие размер модели, назначение, дату оценки и то, является ли система предварительной версией (preview) или полноценным продуктом (production).
Какие бенчмарки показывают реальный прогресс?
Бенчмарки возможностей остаются самым четким способом сравнения систем, однако тесты теряют ценность, когда передовые модели достигают «потолка». Полезная система измерения должна отслеживать как сам балл, так и оставшийся запас возможностей (headroom). Она также должна включать незнакомые задачи, поскольку высокая производительность в одном бенчмарке не гарантирует надежной работы в других областях.
- Согласно AI Index Стэнфордского университета за 2026 год, опубликованному в сентябре 2026 года, почти все ведущие разработчики передовых моделей сообщают о результатах своих возможностей, в то время как отчеты по бенчмаркам ответственного ИИ остаются непоследовательными.
- Согласно данным AI Index Стэнфорда, упомянутым в недавних репортажах, производительность на SWE-bench Verified выросла с примерно 60% до почти 100% за один год.
- Согласно отчету Стэнфорда, количество задокументированных инцидентов с ИИ достигло 362 по сравнению с 233 в 2024 году. Предыдущая цифра является историческим фоном, а не подсчетом за текущий год.
Насыщение бенчмарков создает практическую проблему. Тест, разработанный так, чтобы оставаться сложным в течение нескольких лет, может стать легким уже через месяцы. Следующее поколение оценок должно измерять исследовательскую деятельность с открытым финалом, написание программного обеспечения, научные рассуждения, фактическую точность и устойчивость к манипуляциям в условиях, приближенных к реальному использованию.
Почему длительность задачи становится ключевым показателем?
Длительность задачи измеряет, как долго модель может успешно работать, прежде чем вероятность ошибок возрастет. Вместо того чтобы спрашивать, правильно ли модель отвечает на один вопрос, эксперты проверяют, может ли она выполнить многоэтапную работу, которую квалифицированный человек обычно выполняет в течение определенного периода времени. Этот показатель фиксирует уровень автономности более прямо, чем единый балл точности.
В недавних исследованиях передовых моделей использовалась оценка «горизонта задач» (task-horizon), при которой исследователи оценивают время, затрачиваемое человеком на задачи, и определяют точку, в которой модель справляется примерно в половине случаев. Такой подход позволяет отличить систему, решающую пятиминутные задачи по программированию, от системы, способной справиться с многочасовым инженерным заданием.
- Согласно анализу Big Matrix от 11 сентября 2026 года, METR в течение примерно 100 дней в 2026 году оценил несколько передовых релизов, включая Claude Opus 4.6, GPT-5.4 и Gemini 3.1 Pro.
- Согласно тому же анализу, тестирование горизонта задач измеряет эквивалентную человеческую продолжительность работы до того, как успех модели упадет до 50%.
Этот показатель все еще не является исчерпывающим. Длительные задачи могут скрывать ошибки, а модель может выдавать убедительный, но неверный результат. Оценщикам необходимо фиксировать время на исправление ошибок, использование инструментов, необходимость контроля и стоимость повторных попыток.
Как вычислительные мощности раскрывают темпы работы лабораторий?
Вычислительные ресурсы для обучения дают физическое представление о том, сколько ресурсов лаборатория вкладывает в новые системы. Исследователи могут сравнивать часы работы процессоров, поколения ускорителей, энергопотребление, объем данных и мощность инференса (вывода). Вычисления не равны возможностям, но они помогают объяснить, почему разработка может ускоряться, даже если публичные релизы кажутся схожими.
Данные об обучении часто являются конфиденциальными, и лаборатории раскрывают их неравномерно. Это затрудняет публичные сравнения. Независимые аналитики все же могут отслеживать строительство дата-центров, закупки чипов, облачные контракты и мощности для обслуживания моделей, но эти показатели требуют тщательной атрибуции, так как один объект может поддерживать несколько продуктов.
- Согласно AI Index Стэнфорда за 2026 год, более 90% заметных передовых моделей были разработаны коммерческим сектором, что показывает: ведущие данные измерений все чаще поступают от компаний, а не от университетов.
- Согласно результатам бенчмарков в отчете, прирост возможностей происходит быстрее, чем системы оценки, предназначенные для их измерения.
По этой причине надежный индикатор темпов должен сочетать раскрытые вычислительные мощности с полученным улучшением на единицу этих мощностей. Лаборатория, которая удваивает свое оборудование, но почти не получает прогресса в сложных независимых тестах, может масштабироваться неэффективно. Лаборатория, достигающая больших успехов при аналогичных ресурсах, вероятно, улучшила данные, алгоритмы или методы обучения.
Что добавляют безопасность и надежность?
Результаты тестирования безопасности показывают, сопровождается ли рост возможностей контролем. Модель, которая набирает больше баллов в программировании или рассуждениях, но становится менее правдивой, более уязвимой для эксплуатации или более трудной для мониторинга, не является безусловным улучшением. Поэтому оценки безопасности должны публиковаться вместе с результатами оценки возможностей, а не рассматриваться как отдельный PR-ход.
AI Index Стэнфорда за 2026 год выявил разрыв между повсеместными отчетами по бенчмаркам возможностей и менее последовательными отчетами по тестам ответственного ИИ. Этот разрыв ограничивает возможности сравнения лабораторий. Публичные оценочные карты должны включать показатели галлюцинаций, тестирование на киберзлоупотребления, утечку конфиденциальности, меры предвзятости, точность отказов и производительность при состязательных промптах (adversarial prompting).
- Согласно отчету Стэнфорда за сентябрь 2026 года, отчетность по бенчмаркам ответственного ИИ среди ведущих разработчиков остается фрагментарной.
- Согласно данным Стэнфорда по количеству инцидентов, в последнем наборе данных отчета зафиксировано 362 документально подтвержденных инцидента по сравнению с 233 в 2024 году.
Количество инцидентов не является прямым показателем возможностей модели. Оно лишь показывает, какой ущерб наблюдается и фиксируется в связи с развернутыми системами. Исследователи должны отделять сбои моделей от сбоев, вызванных развертыванием, поведением пользователей или слабыми мерами защиты.
Что должна содержать практическая оценочная карта передовых моделей?
Полезная оценочная карта (scorecard) должна отслеживать одни и те же системы во времени и публиковать достаточно деталей для независимой проверки. Частота релизов дает понимание скорости. Бенчмарки показывают производительность в задачах. Горизонт задач показывает автономность. Вычисления показывают объем инвестиций. Тесты безопасности обеспечивают контроль. Стоимость и надежность показывают, выживают ли результаты лаборатории при контакте с реальными пользователями.
- Интервал релизов: количество дней между сопоставимыми версиями моделей, с отдельной идентификацией предварительных и производственных систем.
- Прирост возможностей: изменение показателей в сложных, устойчивых к «загрязнению» (contamination-resistant) тестах, с указанием даты оценки и версии теста.
- Горизонт задач: максимально длительное задание, эквивалентное человеческому, выполненное с заданной вероятностью успеха.
- Эффективность: прирост возможностей на единицу вычислительной мощности при обучении и на доллар при инференсе.
- Надежность: частота ошибок, фактическая точность, сбои инструментов и объем необходимой человеческой корректировки.
- Безопасность: тесты на вредоносные возможности, результаты конфиденциальности, кибер-оценки, точность отказов и задокументированные инциденты.
Развитие передовых технологий — это не одна гонка, измеряемая одними часами. Наиболее обоснованными будут сравнения, сочетающие публичные записи о релизах с независимыми оценками и четко датированными раскрытиями лабораторий. Такой подход позволит понять, является ли новая система действительно более способной, просто более доступной или же она просто лучше упакована для развертывания.


