Расшифрованная жизнь. Мой геном, моя жизнь (Вентер Крейг)

Алгоритмы, закодированные в полумиллионе строк компьютерного кода команды Джина, предполагали поэтапный сценарий – от самых «безвредных» действий, например простого перекрывания двух последовательностей, до более сложных, например использования обнаруженных пар для слияния островков перекрывшихся последовательностей. Это было похоже на сложение головоломки, когда небольшие островки собранных участков составляются вместе и образуют бо?льшие острова, а затем весь процесс повторяется снова. Только вот в нашей головоломке было 27 миллионов фрагментов. И было очень важно, чтобы участки брались из последовательности высокого качества сборки: представьте себе, что будет, если вы собираете пазл, а цвета или изображения его элементов нечеткие и размытые. Для дальнего порядка последовательности генома значительная доля прочтений должна быть в виде совпадающих пар. Учитывая, что результаты все еще отслеживались вручную, мы с облегчением обнаружили, что 70 % имевшихся у нас последовательностей именно такие. Специалисты по компьютерному моделированию объяснили, что при меньшем проценте собрать нашего «шалтая-болтая» было бы невозможно.

И теперь мы смогли использовать ассемблер Celera для секвенирования последовательности: на первом этапе результаты корректировались для достижения самой высокой точности; на втором этапе программа Screener удаляла загрязняющие последовательности из ДНК плазмиды или E. coli . Процесс сборки может быть нарушен всего-навсего какими-то 10 парами оснований «чужой» последовательности. На третьем этапе программа Screener проверяла каждый фрагмент на соответствие известным повторяющимся последовательностям в геноме плодовой мушки – данным Джерри Рубина, который их «любезно» нам предоставил. Местоположение повторов с частично перекрывающимися участками записывалось. На четвертом этапе другая программа (Overlapper ) обнаруживала перекрывающиеся участки, сравнивая каждый фрагмент со всеми остальными, – колоссальный эксперимент по обработке огромного объема числовых данных. Ежесекундно мы сравнивали 32 миллиона фрагментов с целью обнаружить по крайней мере 40 перекрывающихся пар оснований с менее 6 % различий. При обнаружении двух перекрывающихся участков мы объединяли их в больший фрагмент, так называемый «контиг» – набор перекрывающихся фрагментов.

— 252 —