Учёные заглянули внутрь белковых языковых моделей

Белковые языковые модели, основанные на больших языковых моделях (LLM), широко используются для предсказания структуры и функций белков. Однако принцип их работы оставался «чёрным ящиком» — было непонятно, на какие именно признаки белков они опираются при прогнозах.

Исследователи из MIT применили новый подход, чтобы открыть этот «чёрный ящик». Они использовали алгоритм разреженного автоэнкодера для анализа внутренних представлений белков в нейросети.

Как работает метод

Обычно информация о белке в модели кодируется активацией ограниченного числа нейронов (например, 480), что делает признаки неинтерпретируемыми. Разреженный автоэнкодер расширяет это представление до гораздо большего числа узлов (например, 20 000). Это позволяет «распределить» информацию: один признак белка, ранее закодированный несколькими нейронами, теперь может занимать один конкретный узел.

«В разреженном представлении нейроны активируются более осмысленным образом», — объясняет ведущий автор исследования Онкар Гуджрал.

После получения разреженных представлений для тысяч белков учёные использовали ИИ-ассистента Claude для их анализа. Claude сопоставлял активацию узлов с известными характеристиками белков (молекулярная функция, семейство, локализация в клетке) и описывал их на естественном языке. Например: «Этот нейрон, по-видимому, обнаруживает белки, участвующие в трансмембранном транспорте ионов или аминокислот, особенно расположенные в плазматической мембране».

Результаты и значение

Анализ показал, что наиболее часто кодируемыми признаками были семейство белка и определённые функции, включая различные метаболические и биосинтетические процессы.

«Идентификация признаков, которые отслеживают белковые языковые модели, потенциально может раскрыть новые биологические инсайты», — говорит старший автор исследования Бонни Бергер.

Понимание внутренней работы моделей позволит:

  • Выбирать оптимальную модель для конкретной задачи (например, поиск мишеней для лекарств или дизайн вакцин).
  • Настраивать входные данные для получения лучших результатов.
  • В будущем — извлекать новую биологическую информацию непосредственно из анализа моделей.

Исследование опубликовано в Proceedings of the National Academy of Sciences.

2025-08-19