Anthropic представила Fable 5.1 и результаты тестов
Anthropic выпустила Fable 5.1 — модель, которая по внутренним бенчмаркам опережает Fable 5 и Opus 5; Mythos 5.1 показала успехи в дизайне белков, а Fable 5.1 уточнила карту Венеры.
Anthropic объявила о выпуске Fable 5.1. Компания публикует набор внутренних бенчмарков, где новая версия показывает улучшение в задачах программирования, многодисциплинарных рассуждений и работе с инструментами.
По данным Anthropic, на научном бенчмарке Terminal-Bench-Science 0.1 Fable 5.1 набирает 52,6% против 24,7% у Fable 5. В тесте программирования Terminal-Bench 4.0 результат составляет 55,8% против 42,0% у Fable 5; версия Mythos 5.1 на том же тесте показывает 60,9%, при этом часть различий объясняется блокировкой некоторых задач внутренними кибер-классификаторами Fable 5.1. На CursorBench 3.2.0 для агентного кодинга Fable 5.1 достигает 73,4% против 70,5% у Fable 5. Для мультидисциплинарных рассуждений на Humanity’s Last Exam модель показывает 65,0% с инструментами и 60,9% без них. По использованию компьютера на OSWorld 2.0 Fable 5.1 набирает 77,9% в мягком режиме подсчёта и 41,7% в строгом.
В сравнительной таблице Anthropic Fable 5.1 опережает Fable 5, Opus 5 и GPT-5.6 Sol от OpenAI по большинству метрик, включая показатели по автоматизации рабочих процессов (AutomationBench: 31,4%) и знаниевые тесты (GDPval-AA v2: 1853 балла). Компания отмечает важную оговорку: при тестировании были включены защитные классификаторы, и на задачах, где они срабатывали, модели присваивался ноль баллов, что снижает результаты на отдельных бенчмарках.
Партнёры раннего доступа привели прикладные метрики. Инвестиционная компания Every охарактеризовала модель как «интеллект уровня Fable, цена уровня Opus, скорость уровня Sonnet» и сообщила, что Fable 5.1 оказалась примерно вдвое быстрее Opus 5 и расходовала вдвое меньше токенов. Сервис Browserbase зафиксировал выполнение 82% задач на своём сложном браузерном бенчмарке против 74% у Opus 5 и 57% у Fable 5, при меньшем расходе токенов. Юридический стартап Crosby зарегистрировал рост точности правки контрактов с 47,9% до 57,0% по своему бенчмарку. Финансовый сервис Rogo указал на ту же точность, что у Fable 5, при расходе токенов на 20% ниже.
В отдельном разделе Anthropic описала научные эксперименты. Mythos 5.1 при работе с открытыми инструментами дизайна белков сконструировала высокоаффинные связывающие белки по трём мишеням; компания приводит сравнение с конкурсными работами Adaptyv Bio и указывает качество в десять раз выше лучших из них и долю успешных попыток около 50%, тогда как в отрасли обычно отмечают 10–15%. Fable 5.1 использовала нейросеть для переработки радиолокационных данных миссии Magellan и построила новую карту высот примерно трети поверхности Венеры: детализация увеличилась с 10–20 км до 2–3 км, а точность высот повысилась примерно на четверть.
Anthropic сообщает, что новые версии продолжают развитие семейств Fable и Opus и демонстрируют сочетание производительности, экономии токенов и работы с инструментами. Для демонстрации эффективности компания использовала собственные и партнёрские бенчмарки и указывает, что включённые меры безопасности влияют на итоговые показатели в ряде тестов.
Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.








