Дослідники Каліфорнійського університету в Сан-Дієго (США) повідомили про значний прорив у генетиці: за допомогою алгоритмів штучного інтелекту їм вдалося розшифрувати так звану стартову (початкову) послідовність людської ДНК. За даними авторів, результати роботи опубліковані в науковому журналі Genes and Development. На їхню оцінку, відкриття відкриває можливість точнішого прогнозування ризику розвитку раку та низки інших складних генетичних захворювань на дуже ранньому етапі — задовго до появи клінічних симптомів.

Що таке «стартова послідовність» і чому вона важлива

Для нормального розвитку та росту організму критично важливе точне функціонування десятків тисяч генів. Всередині клітин сегменти ДНК координують генетичні послідовності, забезпечуючи виробництво ферментів, гормонів і білків, від яких залежать біологічні функції. Якщо ці гени активуються неправильно, клітини можуть перестати нормально працювати або перетворитися на злоякісні пухлини. Саме тому розуміння того, як і коли ген «увімкнується», вважається одним із ключових питань сучасної молекулярної біології.

Як ШІ проаналізував півмільйона варіантів промоторів

Щоб з'ясувати механізм перемикання генів, дослідницька група зосередила увагу на аналізі промоторної ділянки ДНК — фрагмента, який вважається стартовою точкою, де кодувальні інструкції гена вперше перетворюються на функціональні клітинні продукти. Робота велася під керівництвом аспіранта Торрі Райн-Каррігга та професора Джеймса Т. Кадонагі. Комбінація високотоверного секвенування ДНК та алгоритмів машинного навчання дозволила проаналізувати дані приблизно за 500 000 варіантів промоторної ділянки. Модель ШІ, навчена на цьому масиві, ідентифікувала характерний патерн стартової послідовності та встановила, що ця ділянка присутня приблизно в 60% усіх генів людини.

Від розшифрування коду до прогнозу раку та генної терапії

За словами професора Джеймса Т. Кадонагі, вперше було продемонстровано, що подібні моделі ШІ мають потужні прогностичні можливості щодо наявності чи відсутності стартової послідовності в генах людини та успішно розшифрували структуру послідовності основ ДНК цього фрагмента. Виявлення цього механізму, на оцінку авторів, закладає основу для аналізу впливу навіть найменших мутацій, які є однією з основних причин раку та багатьох генетичних дефектів. Окрім діагностики, отримані дані дозволяють створювати штучні сегменти ДНК, здатні вмикати та вимикати гени за завданням, що обіцяє стати інструментом генної терапії для виправлення дефектних ділянок коду до виникнення захворювань.

Значення для медицини майбутнього та застереження щодо джерела

Автори називають цей результат значним зсувом, що об'єднує лабораторні експерименти зі штучним інтелектом для розуміння генетичного коду людини: в кожній клітині, що містить близько 6 мільярдів основ ДНК, існує унікальний код експресії генів, який визначає, коли і наскільки активний кожен ген. Розшифрування ділянки походження, за їхніми словами, є першим кроком до створення всеохоплюючої моделі ШІ для всього генетичного коду, здатної прогнозувати та запобігати захворюванням. При цьому слід враховувати, що в російськомовній подачі матеріалу (переклад в'єтнамських видань) конкретна дата публікації в Genes and Development та точне написання імен авторів не наведено послідовно, а додаткові новинні джерела з теми «ШІ та онкологія» стосуються інших, не пов'язаних із цією роботою досліджень, тому фактичні деталі спираються переважно на одне перекладне джерело.