AlphaGenome Atlas: a high-resolution map of human DNA 🔥 Горячее
AlphaGenome Atlas — это база данных, предсказывающая эффекты всех возможных однонуклеотидных вариантов в геноме человека. С помощью модели AlphaGenome учёные предварительно посчитали регуляторное влияние 9 миллиардов однонуклеотидных изменений, получив набор данных в 1 петабайт. Для удобства работы введён показатель AVI — единая оценка влияния варианта, объединяющая предсказания для кодирующих и некодирующих регионов, позволяющая быстро выявлять приоритетные мутации.
Инструмент уже применяется в исследованиях: в Broad Institute команда Лауры Ковилл использовала AVI для приоритизации вариантов при изучении редких заболеваний и выявила критичный вариант в гене DNM1, создающий ошибочный сайт сплайсинга, что помогло решить клинический случай. Доктор Гарет Хоукс из UK Biobank проанализировал данные 54 000+ участников, сгруппировав варианты по предсказанному молекулярному эффекту, и обнаружил на 22% больше некодирующих ассоциаций с комплексными признаками. Фокусировка на топ-1% самых влиятельных вариантов выявила 19 геномных регионов, связанных с ИМТ. Atlas доступен через веб-портал без необходимости программирования, открывая доступ клиническим исследователям и биологам по всему миру.
Комментарии (123)
AlphaGenome Atlas не превосходит Borzoi — это предварительно рассчитанная база данных на его основе, а не научный прорыв, а лишь кэширование. Не валидированы экспериментально, нет оценки надёжности для редких или неизвестных вариантов. Не работает с инделами, только с SNP. Неприменим к данным 23andMe из-за низкого охвата генома. Не поддерживает промоторы и динамику транскрипции, ограничивая анализ регуляторных вариантов. Обучен только на человеческом геноме — не применим к другим организмам, включая Nebula. Предсказания недостаточны без сравнительных данных из других видов. Использование разрешено только для некоммерческих целей, что вызывает опасения о доступе фармацевтических компаний через партнёрства. Не имеет отношения к AlphaFold — это работа в регуляторной геномике, основанная на Enformer (Зига Авсек), а не на Демисе Хассабисе. Именование как «Alpha___» вызывает скепсис как маркетинговый приём, создающий иллюзию прорыва без реального улучшения. Доступ без аффилиации возможен через «None». Упрощает доступ для не-программистов, но не решает проблему интерпретации без экспериментальной валидации.
CRISPR tech selectively shreds cancer cells, including "undruggable" cancers 🔥 Горячее 💬 Длинная дискуссия
Ученые из Инновационного геномного института показали, что новая CRISPR‑технология может целенаправленно уничтожать раковые клетки, включая формы заболевания, ранее считавшиеся «неподвластными лекарствам». Система использует модифицированный Cas‑нuclease, который распознаёт уникальные РНК‑фрагменты, характерные только для опухолевых клеток, и разрывает их, вызывая апоптоз. В отличие от традиционных препаратов, подход не требует наличия конкретных мутаций в ДНК и может воздействовать на широкий спектр опухолей, включая панкреатический и яичник ый рак.
В экспериментах на культурах клеток и в мышиных моделях терапия уничтожала более 90 % онкологических клеток, при этом нормальные ткани оставались нетронутыми. По словам лидера проекта, «мы научились программировать CRISPR так, чтобы он «видел» молекулярный отпечаток каждой опухоли и уничтожал её, не затрагивая здоровый организм». Успех открывает путь к первым клиническим испытаниям, которые могут начаться уже в ближайшие годы, предлагая новый шанс пациентам с опухолями, для которых до сих пор нет эффективных средств.
Комментарии (220)
- Ученые используют CRISPR/Cas12a2 для обнаружения специфических мутаций в раковых клетках и последующего их уничтожения, что более разрушительно, чем традиционный Cas9.
- Основной проблемой остается доставка ферментов в нужные клетки без иммунных реакций и охват всех опухолевых клеток.
- Несмотря на технические трудности, подход считается значительным шагом к более точному и персонализированному лечению рака.
- Обсуждение также затрагивает экономические и политические аспекты, где интересы прибыли иногда ставятся выше научных открытий.
Removing newlines in FASTA file increases ZSTD compression ratio by 10x 🔥 Горячее
Режим --long в Zstandard значительно улучшает сжатие геномных последовательностей, но требует удаления символов новой строки внутри записей.
Специализированные методы сжатия ДНК, такие как MiniPhy, достигают коэффициента сжатия (CR) 91, но работают медленно. Zstandard со стандартными настройками сжимает в 10 раз быстрее, но с CR всего 3.
Использование --long без удаления переносов дало скромное улучшение — CR 3.8. После удаления переносов (seqtk seq -l 0) CR вырос до 11. С максимальным размером окна (--long=31) CR достиг 31, уменьшив размер данных с 2.46ТБ до 80ГБ при увеличении времени сжатия на 80% по сравнению со стандартными настройками.
Хотя --long не дотягивает до специализированных методов, он предлагает хороший баланс между скоростью и эффективностью сжатия для больших файлов с повторяющимися последовательностями. Главное — предварительно удалить переносы строк.
Комментарии (104)
- Удаление незначащих переносов строк в формате FASTA значительно улучшает сжатие Zstd, так как они нарушают поиск длинных совпадений.
- Zstd — байтовый компрессор, не учитывающий семантику данных, поэтому случайные переносы строк снижают его эффективность.
- Использование больших размеров окна (--long) в Zstd улучшает сжатие геномных данных, но требует больше памяти и совместимых настроек при распаковке.
- FASTA и FASTQ критикуются как неэффективные форматы, но остаются популярными из-за простоты и широкой поддержки.
- Для обработки больших геномных данных часто рекомендуется конвертировать FASTA/FASTQ в бинарные или колоночные форматы (например, Parquet).
- Создание специализированных словарей или препроцессинг данных могут значительно улучшить сжатие для специфичных структур.
- Геномные данные обладают высокой избыточностью из-за общих последовательностей у разных видов, что эффективно используется компрессорами.
- Многие инструменты биоинформатики используют внутренние бинарные форматы, но FASTA остаётся стандартом для обмена данными.
- Проблемы с устаревшими форматами и инструментами в биоинформатике частично связаны с трудностями финансирования их поддержки.