OpenAI представила GeneBench-Pro для оценки ИИ в биологии

OpenAI представила GeneBench-Pro для оценки ИИ в биологии

Компания OpenAI представила усложненный бенчмарк GeneBench-Pro, предназначенный для тестирования способности моделей искусственного интеллекта выполнять глубокий анализ в молекулярной биологии и геномике. Разработчики сместили фокус с простых тестов на проверку способности ИИ-агентов выстраивать цепочки научных рассуждений.

Традиционные методы оценки нейросетей часто проверяют лишь усвоение теоретических знаний или выполнение простых одношаговых инструкций. В реальных условиях молекулярным биологам и биоинформатикам приходится работать с зашумленными данными и принимать решения, влияющие на ход всего эксперимента. Новый бенчмарк GeneBench-Pro призван смоделировать эту среду для оценки ИИ-агентов.

Особенности нового бенчмарка

GeneBench-Pro включает в себя 129 задач, охватывающих 10 ключевых областей биологии и 21 поддомен. Основное отличие новой версии — наличие так называемых инференциальных развилок. Это этапы анализа, на которых неверный выбор метода обработки данных или фильтрации шума на ранней стадии делает итоговый результат полностью недостоверным. ИИ-агенты должны уметь самостоятельно находить ошибки и вовремя корректировать стратегию исследования.

Для обеспечения объективности тестов OpenAI использует синтезированные наборы данных с заранее известными точными значениями. Это исключает утечку информации при обучении моделей и позволяет оценивать результаты детерминированно.

Результаты тестирования современных моделей

Первые испытания показывают, что сложные научные исследования остаются серьезным вызовом для нейросетей. Флагманская модель GPT-5.6 Sol от OpenAI на максимальной глубине планирования смогла правильно решить только 28,7% задач. При активации специального режима рассуждений Pro этот показатель увеличился до 31,5%.

Несмотря на то, что это значительный шаг вперед по сравнению с предыдущими поколениями ИИ, набиравшими менее 5% правильных ответов, разработчики подчеркивают: современные ИИ-помощники все еще требуют постоянного контроля со стороны профильных специалистов и не могут работать автономно в лабораториях.

Источники

Редакция: Soft-Buy.ru
Дата публикации: 07.07.2026. Дата обновления: 07.07.2026.
Как проверяли: первоисточники, официальные публикации, документацию, changelog или профильные материалы, использованные в статье.
Важно: материал носит редакционный характер; рекламные, партнёрские и неподтверждённые источники не используются в автоматическом workflow публикации.

Случайные статьи

Статья Бейонсе мечтает о собственной игре добавлена с разрешения редакции сайта Игромания.Автор: Роман Епишин. В интервью журналу Billboard знаменитая певица Бейонсе заявила, что ...
До выхода игры остается уже менее двух месяцев, при этом ролике о игре продолжают появляться на YouTube....
Компания AMD объявила о покупке молодой компании MEXT, разрабатывающей интеллектуальные алгоритмы многоуровневого распределения памяти (memory tiering). Данное приобретение призван...
Разработчики из независимой студии Steelkrill Studio представили свой новый проект — психологический хоррор на выживание Where Dolls Hang. Игра черпает вдохновение из мрачного мекс...
Оригинал статьи можно прочесть перейдя по ссылке Deus Ex: сценарий толщиной с телефонную книгу на сайте "Игромания".Мэри Демарли сценарист ролевого экшена Deus Ex: Human Revolution...