Обновление демонстрирует заметный качественный скачок в профильных тестах. В испытаниях FrontierCode 1.1 Main точность генерации готового кода поднялась с 34,4% до 43,6%, а в DeepSWE v1.1 результат вырос с 49% до 65,3%. Модель лучше справляется с версткой UI, точнее копируя дизайн-макеты и скриншоты, что подтверждается рейтингом 1588 баллов Elo на WebDev Arena.
Помимо написания кода, разработчики улучшили работу с документацией и бизнес-автоматизацией. В тесте GDP.pdf модель показала 34% точности против 22% у предшественницы, а в AutomationBench её результативность подскочила с 17% до 30,4%. Улучшенное многошаговое планирование позволяет системе реже требовать ручной корректировки при выполнении сложных инструкций.
Функциональность уже внедрена в персонального агента Gemini Spark, доступного пользователям платных подписок в 160 странах. Одновременно Google усилила протоколы безопасности, ограничив возможности модели в контексте кибератак и создания опасных веществ. Инструменты для интеграции новой версии открыты через API, Google AI Studio и платформу Enterprise Agent.

Комментарии (0)
Пока нет комментариев. Будьте первым!