Anthropic представила Claude Opus 5 с лучшими результатами в программировании

AI Сгенерировано ИИ
Компания Anthropic анонсировала Claude Opus 5 — новую флагманскую модель искусственного интеллекта, которая, по словам разработчиков, демонстрирует выдающиеся результаты в программировании и интеллектуальных задачах, сохраняя ту же стоимость использования, что и предшественник. Об этом сообщает Новая Наука.
Модель доступна на всех платформах Anthropic по цене 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов. Пользователи также могут выбрать ускоренный режим, который работает примерно в 2,5 раза быстрее стандартного, но стоит в два раза дороже.
Opus 5 была разработана для решения сложных задач программной инженерии, автоматизации бизнес-процессов, научных исследований и взаимодействия с компьютером. Компания позиционирует её как инструмент для повседневного использования, а не только для сложных задач.
В тесте Frontier-Bench v0.1, который оценивает возможности в программной инженерии, Opus 5, по данным Anthropic, превзошла другие проверенные модели и более чем в два раза улучшила результат по сравнению с Opus 4.8 при меньшей стоимости выполнения одной задачи.
В тесте CursorBench 3.2 при максимальном уровне усилий новая модель отстала менее чем на 0,5% от максимального результата Claude Fable 5, но стоимость выполнения одной задачи оказалась в два раза ниже.
Преимущества Claude Opus 5, по данным Anthropic, также проявляются в других областях. В тесте ARC-AGI 3, оценивающем способность искусственного интеллекта решать новые задачи, модель показала результат в три раза выше, чем ближайшая конкурентная система.
В тесте Zapier AutomationBench, который проверяет способность моделей выполнять бизнес-задачи от начала до конца, Opus 5 достигла примерно в 1,5 раза более высокой доли успешных решений по сравнению с следующей лучшей моделью при одинаковой стоимости одной задачи.
Модель также показала лучшие результаты в тесте OSWorld 2.0, предназначенном для оценки взаимодействия с компьютером. Opus 5 превзошла Fable 5 при стоимости выполнения задачи более чем в три раза ниже.
Anthropic сообщила об улучшении возможностей модели в научных исследованиях, особенно в области наук о жизни. Внутренний тест по органической химии, включавший определение молекулярных структур на основе спектроскопии, показал, что Opus 5 набрала на 10,2 процентного пункта больше, чем Opus 4.8.
На задачах, связанных с влиянием изменений последовательности белков на их функции, улучшение составило 7,7 процентного пункта.
Компания заявила, что новая модель стала лучше проверять собственные результаты и предпринимать повторные попытки, если первоначальный подход оказывается неудачным. В одном из тестов Opus 5 получила изображение детали механизма и самостоятельно создала компьютерное зрение для извлечения геометрии из исходных пикселей.
Вместе с запуском Claude Opus 5 Anthropic представила бета-функции для разработчиков, позволяющие менять доступные инструменты во время диалога без сброса кэша промптов.
Opus 5 стала моделью по умолчанию для пользователей Claude Max и наиболее мощной моделью, доступной подписчикам Claude Pro.



