Прорыв в хранении данных на ДНК: случайный доступ к 200 МБ информации

Исследователи из Университета Вашингтона и Microsoft представили систему хранения цифровых данных в синтетической ДНК, установив новый мировой рекорд — 200 мегабайт. Их работа, опубликованная в Nature Biotechnology, впервые демонстрирует случайный доступ (random access) к отдельным файлам в массиве из более 13 миллионов олигонуклеотидов ДНК.

Превосходство ДНК как носителя

ДНК обладает колоссальной плотностью хранения: теоретический предел — один эксабайт (миллиард гигабайт) на кубический миллиметр. Однако процесс записи (преобразование цифровых 0 и 1 в молекулы аденина, тимина, цитозина и гуанина) и чтения (секвенирование и декодирование) сопряжён с ошибками и сложностью извлечения конкретных данных без полной обработки всего массива.

Ключевые инновации

Команда Molecular Information Systems Laboratory (MISL) решила эти проблемы:

  1. Библиотека праймеров для случайного доступа: Перед синтезом ДНК к концам каждой последовательности добавлялись мишени для праймеров ПЦР (PCR) из специально разработанной библиотеки. Это позволяет с помощью ПЦР избирательно амплифицировать и извлекать нужные файлы.
  2. Устойчивые алгоритмы декодирования: Создан новый алгоритм, эффективно исправляющий ошибки, возникающие при синтезе и секвенировании ДНК, что минимизирует потерю данных.

Рекордные результаты

Используя синтетическую ДНК от Twist Bioscience, команда закодировала и успешно извлекла 35 различных файлов (от 29 КБ до 44 МБ каждый), включая HD-видео, аудио, изображения и текст. Это в 10 раз больше предыдущего рекорда в 22 МБ.

Перспективы и масштабирование

  • Масштабируемость: Подход позволит создавать изолированные пулы ДНК, содержащие несколько терабайт данных каждый. В обезвоженном виде они будут на порядки плотнее магнитных лент.
  • Динамичное развитие: После подачи статьи объём хранимых данных в лаборатории уже превысил 400 МБ.
  • Будущее: Снижение стоимости синтеза и секвенирования ДНК открывает путь для практического развития этой технологии.

Мнение исследователей

  • Сергей Еханин (Microsoft): «Наша работа сокращает усилия по полному восстановлению информации, хранящейся в ДНК, как в части мощности секвенирования, так и в обработке данных».
  • Луис Сезе (Университет Вашингтона): «Пересечение биотехнологий и компьютерных архитектур невероятно перспективно».
  • Карин Штраусс (Microsoft): «Хранение данных на ДНК — невероятно захватывающая область».
  • Ли Органик (аспирант): «Мы находимся в то время, когда множество прорывных исследований будет сделано на стыке областей».