Discovery Loop 🔥 Горячее 💬 Длинная дискуссия
Научный прогресс застопорен из-за рутинных экспериментальных циклов: гипотеза — запуск — анализ — корректировка. Discovery Loop предлагает автоматизировать весь этот процесс, используя ИИ и вычислительные мощности для одновременного проведения тысяч экспериментов. Это сокращает время итераций и повышает качество результатов, особенно в машинном обучении, где первые шаги будут направлены на оптимизацию собственной технологической инфраструктуры.
Команда, состоящая из Джеффа Диана, Санджая Гематева, Квока Лэ и Ориоля Виньяльса, объединяет экспертизу в создании ключевых технологий: от TensorFlow и Pathways до AlphaFold и Gemini. Их преимущество — не только глубокие навыки, но и опыт построения систем, масштабирующих вычисления на уровне всего мира. Цель — дать исследователям и инженерам возможность ускорять открытия, решая задачи от разработки лекарств до обеспечения чистой воды, превращая науку в более доступный и эффективный процесс.
Комментарии (507)
Тред обсуждает потенциал и ограничения автоматизации научных исследований, особенно в ML и ИИ, выражая сомнения в возможности полной автоматизации экспериментальных циклов — например, в биологии. Участники подчеркивают, что автоматизация полезна, но не должна заменять человеческий интеллект и критическое мышление. Отмечается впечатляющий опыт команды Discovery Loop в ML и ИИ. Также предупреждают о рисках: ошибках и предвзятости алгоритмов, а также о том, что не все научные процессы поддаются автоматизации.
TPUs vs. GPUs and why Google is positioned to win AI race in the long term 🔥 Горячее 💬 Длинная дискуссия
Google TPU возник в 2013 году из расчёта: если каждый пользователь Android задействует voice search по 3 минуты в день, компании придётся удвоить мощности дата-центров. Стандартные CPU и GPU не справлялись с матричной математикой глубокого обучения, поэтому Google создал ASIC для TensorFlow. Проект прошёл от концепта до деплоя за 15 месяцев (2013–2014), к 2015 TPU уже ускоряли Maps, Photos и Translate, а в 2016 их анонсировали на I/O.
В отличие от универсальных GPU с «багажом» (кеширование, ветвления, текстуры), TPU — доменно-специфичный чип с systolic array: данные (веса) загружаются раз, проходят через сетку умножителей без возврата в память, минимизируя Von Neumann bottleneck и HBM-доступы. Новый Ironwood усилил SparseCore для эмбеддингов (рекомендации, LLM) и расширил HBM. TPU — ключевое преимущество Google Cloud на 10 лет, с фокусом на inference; обсуждаются производство, сравнения с GPU и влияние Gemini 3.
Комментарии (260)
- Google's TPUs лидируют в эффективности inference и масштабе благодаря systolic array, OCS interconnects и низкой стоимости эксплуатации по сравнению с Nvidia GPUs.
- Скепсис по поводу исполнения Google: слабая экосистема (JAX/TF vs CUDA), история провалов продуктов и зависимость от ad-бизнеса.
- Nvidia доминирует за счёт универсальности, CUDA и оптимизаций (NVLink, NVFP4), несмотря на "architectural baggage".
- Упоминания альтернатив (Groq, Cerebras, Meta покупает TPU) и рисков: новые архитектуры AI могут устареть hardware, фокус на inference vs training.
- Google имеет ресурсы для доминирования через vertical stack и cloud, но короткий "attention span" вызывает сомнения.
Backpropagation is a leaky abstraction (2016) 🔥 Горячее
Карпати утверждает, что понимание обратного распространения ошибки (backprop) критически важно, несмотря на автоматизацию в фреймворках вроде TensorFlow. Он называет backprop "утечкой абстракции" — опасно верить, что просто соединяя слои, можно "магически" обучить сеть. Студенты курса CS231n жаловались на ручную реализацию backprop в numpy, но Карпати настаивает: без понимания математики невозможно диагностировать проблемы обучения.
Яркий пример — сигмоидные функции. При плохой инициализации весов сигмоиды "насыщаются" (выходы близки к 0 или 1), делая локальный градиент z*(1-z) равным нулю. Это полностью останавливает обучение. Даже при нормальных условиях градиент сигмоиды не превышает 0.25 (при z=0.5), что означает его 4-кратное ослабление при каждом проходе. Для сетей с сигмоидами нижние слои учатся значительно медленнее верхних.
Комментарии (131)
- Обсуждение вращается вокруг статьи Карпати "Yes, you should understand backprop" и его тезиса о том, что понимание backprop важно, даже если вы никогда не будете писать его вручную.
- Участники спора сомневаются в ценности этого подхода, указывая на то, что современные фреймворки и высокоуровневые абстракции делают знание деталей неактуальным.
- Некоторые участники подчеркивают, что даже если вы не будете реализовывать backprop вручную, понимание принципов работы оптимизаторов и функций активации важно для отладки и проектирования моделей.
- Обсуждение также затрагивает вопрос о том, насколько важно понимать детали, когда вы пользуетесь высокоуровневыми инструментами, и какие уровни абстракции считаются приемлемыми.
- В конце концов, спор сводится к тому, что хотя фундаментальное понимание важно, но не стоит забывать, что большинство практических задач будут решаться с помощью высокоуровневых инструментов и фреймворков.