Hacker News Digest

Тег: #data-analysis

Постов: 8

WeatherNext 2: Our most advanced weather forecasting model (blog.google) 🔥 Горячее

Google DeepMind представила WeatherNext 2, свою самую передовую модель прогнозирования погоды. Новая ИИ-система обеспечивает более эффективные, точные и высокоразрешающие глобальные прогнозы по сравнению с предыдущими методами. Модель способна обрабатывать огромные объемы метеорологических данных и предсказывать погодные условия с повышенной точностью в различных регионах мира.

WeatherNext 2 использует передовые нейросетевые архитектуры для анализа исторических и текущих данных о погоде, что позволяет делать прогнозы на более длительные периоды с меньшими вычислительными затратами. По словам разработчиков, модель превосходит традиционные методы точности прогнозирования экстремальных погодных явлений, таких как ураганы и сильные дожди, что может помочь в принятии решений в области сельского хозяйства, энергетики и управления чрезвычайными ситуациями.

by meetpateltech • 17 ноября 2025 г. в 15:04 • 273 points

ОригиналHN

#artificial-intelligence#data-analysis#google#google-deepmind#machine-learning#neural-networks#weather-forecasting

Комментарии (123)

  • Google представил WeatherNext 2 — модель для прогнозирования погоды, генерирующую сценарии в 8 раз быстрее с повышенным разрешением.
  • Пользователи отмечают низкую точность стандартных приложений (Google, Apple), особенно в прогнозах осадков и температуры.
  • Ключевая особенность ведущих моделей (включая WeatherNext) — обучение с CRPS-функцией потерь и добавлением случайного шума для улучшения прогнозов.
  • Исторически прогнозы часто были неточными, но оставались необходимыми для планирования (аналогия с военными временами).
  • Альтернативные сервисы (Windy, Dark Sky) и сравнение моделей (ECMWF, GFS) предлагаются для более точных данных.

What Americans die from vs. what the news reports on (ourworldindata.org) 🔥 Горячее 💬 Длинная дискуссия

Исследование Our World in Data показывает значительный разрыв между реальными причинами смерти в США и тем, что освещают СМИ. Анализ данных CDC за 2023 год показывает, что основные причины смерти (сердечно-сосудистые заболевания, рак, респираторные болезни) практически не получают должного внимания в прессе. Вместо этого СМИ концентрируются на редких событиях, таких как теракты и убийства. Три крупнейших издания - New York Times, Washington Post и Fox News - демонстрируют поразительно схожие паттерны освещения тем, несмотря на их политические различия.

Хотя Fox News немного чаще упоминает убийства, а NYT - теракты, различия в выборе тем несущественны. Исследование охватывает 76% всех смертей в США, включая 12 основных причин плюс убийства, передозировки наркотиков и терроризм. Парадоксально, что хотя более 80% людей следят за новостями, чтобы "узнать, что происходит в мире", а NYT заявляет, что помогает "понять мир", их освещение реальных угроз здоровью не соответствует действительности.

by alphabetatango • 14 октября 2025 г. в 18:40 • 583 points

ОригиналHN

#cdc#data-analysis#health-statistics#media-bias#news-media#ourworldindata

Комментарии (366)

  • Смертность от сердечно-сосудистых заболеваний и рака составляет 56% всех смертей, но получает лишь 7% медийного освещения, в то время как терроризм и убийства, вызывающие менее 0,5% смертей, занимают непропорционально большую долю новостного пространства.
  • СМИ фокусируются на редких, но драматичных событиях, потому что это увеличивает трафик и, следовательно, доходы от рекламы.
  • Показатели смертности от сердечно-сосудистых заболеваний и рака в США составляют 56% всех смертей, но получают лишь 7% медийного освещения.
  • СМИ не отражают главные причины смертности, такие как болезни сердца и рак, которые вместе ответственны за более чем половину всех смертей.
  • Вместо этого, они фокусируются на редких, но драматичных событиях, таких как терроризм и убийства, которые вместе ответственны за <0.5% смертей.

Show HN: Dayflow – A git log for your day (github.com) 🔥 Горячее

Dayflow автоматически создаёт таймлайн дня на основе данных с устройств Apple. Он использует машинное обучение для анализа активности, местоположения и приложений, превращая сырые данные в структурированную хронологию событий. Это помогает пользователям визуализировать, как проходит их день, без ручного ввода.

Проект работает локально, обеспечивая конфиденциальность данных, и поддерживает экспорт в JSON или Markdown для дальнейшего использования. Полезно для самоанализа, ведения дневника или отслеживания продуктивности.

by jerryliu12 • 24 сентября 2025 г. в 14:53 • 407 points

ОригиналHN

#apple#data-analysis#github#json#local-storage#machine-learning#markdown#privacy#productivity

Комментарии (115)

  • Предложения по применению: для юристов и фрилансеров для учёта рабочего времени, для людей с СДВГ для анализа отвлечений, для автоматизации отчётов на стендапах.
  • Обеспокоенность приватностью и безопасностью: отправка скриншотов в облако вызывает опасения по поводу паролей и конфиденциальных данных; предпочтение отдаётся локальным моделям.
  • Технические вопросы и предложения: работа с несколькими мониторами, частота записи, интеграция с другими данными (Apple Health), создание API для расширений.
  • Юридические и этические аспекты: необходимость согласия на запись в видеозвонках, потенциальное misuse со стороны работодателей для контроля сотрудников.
  • Позитивные отзывы: отмечается удобство, качественный UX и возможность использования локальных моделей для конфиденциальности.

Everything is correlated (2014–23) (gwern.net)

Всё коррелировано

В реальных данных почти все переменные связаны между собой, и корреляции не исчезают при росте выборки. Это ставит под сомнение стандартное нулевое гипотезное тестирование: при достаточном объёме данных нулевая гипотеза всегда отвергается, а отказ от отвержения лишь говорит о нехватке данных. Даже направленный эффект подтверждает теорию лишь на 50 % — как случайное угадывание.

Исторические заметки

  • 1904 — «Student» (Госсет) замечает, что в биометрии всё связано.
  • 1920 — Торндайк формулирует «всё связано со всем».
  • 1938–39 — Берксон и Торндайк подтверждают: корреляции не случайны.
  • 1950-е — Гуд, Сэвидж, Фишер обсуждают «всё-равно-ложную» нулевую.
  • 1960-е — Наннали, Бакан, Мил указывают на бессмысленность p > 0.05.
  • 1976 — Лёлин и Николс: в исследовании 850 близнецов 90 % пар переменных коррелированы.
  • 1990-е — Мил: «фактор грязи» (crud factor) делает большинство «подтверждений» иллюзорными.
  • 2000-е — Уоллер, Килгарриф, Старбак повторяют: «всё коррелировано» в психометрике, лингвистике, экономике.
  • 2013–2023 — Гельман, Лин, Киркегорд, Шен, Гордон, Дауни: эмпирические датасеты подтверждают закономерность.

Практические выводы

  • Любая теория предсказывает не только наличие, но и размер эффекта; без него подтверждение тривиально.
  • «Спарсность» (редкие ненулевые связи) в соцнауках — миф.
  • Вместо p-value нужны байесовские оценки и априорные модели размера эффекта.

by gmays • 22 августа 2025 г. в 02:05 • 243 points

ОригиналHN

#bayesian-statistics#causality#correlation#data-analysis#effect-size#hypothesis-testing#p-value#statistics

Комментарии (107)

  • Статистическая значимость ≠ практическая важность: p-value лишь показывает, насколько «хорошо» измерена разница, но не её смысл.
  • Многие наблюдаемые корреляции — «фоновый шум» данных; без эксперимента или теории они бесполезны.
  • Большие N и множественные проверки порождают ложные значимости, особенно если гипотезы формулируются постфактум.
  • Критика статьи: смесь верных статистических замечаний с политическими спекуляциями и отсутствием практических рекомендаций.
  • Вывод: нужны эффект-размер, каузальные методы и заранее заданные гипотезы, а не охота на p < 0.05.

95% of Companies See 'Zero Return' on $30B Generative AI Spend (thedailyadda.com) 🔥 Горячее 💬 Длинная дискуссия

95 % компаний не получают отдачи от $30 млрд, потраченных на генеративный ИИ, — MIT

  • Исследование MIT: только 5 % проектов приносят измеримую пользу.
  • Причины: нечёткие KPI, отсутствие данных, недостаток навыков персонала.
  • Вывод: без стратегии и качественных данных ИИ превращается в дорогую игрушку.

by speckx • 21 августа 2025 г. в 15:36 • 294 points

ОригиналHN

#ai-strategy#artificial-intelligence#automation#data-analysis#generative-ai#kpi#llm#mit

Комментарии (283)

  • 5 % проектов приносят деньги, 95 % — нет: основная причина — отсутствие чёткого плана и метрик.
  • Реальные экономии уже есть: автоматизация пост-обработки звонков в кол-центрах экономит миллионы.
  • Рынок перегрет: многие запускают «AI-инициативы» ради хайпа и финансирования, не ради пользы.
  • Компании тратят деньги на консультантов и маркетинг вместо решения конкретных задач.
  • Наблюдается спад доверия («Trough of disillusionment»), но технология остаётся ценной как встроенная функция, а не как отдельный продукт.

A statistical analysis of Rotten Tomatoes (statsignificant.com)

Rotten Tomatoes: стал ли он менее надёжным?

Вступление

В отельных рекламах почти каждый новый фильм теперь «Certified Fresh». Либо человечество перестало снимать плохое кино, либо сама система оценки изменилась. Данные говорят: второе.

Как работает RT

  • Tomatometer = доля «положительных» рецензий критиков.
  • ≥ 60 % = «Fresh», < 60 % = «Rotten».
  • ⅓ американцев проверяют RT перед походом в кино.

Что случилось с оценками

1. Средний балл растёт
С 2000 по 2023 г. средний Tomatometer вырос с 51 % до 75 %.

  • 2000-е: 47 % фильмов ≥ 75 %.
  • 2020-е: уже 74 %.

2. «Rotten» почти исчез
Доля «гнилых» фильмов упала с 43 % (2000) до 12 % (2023).

3. Дисперсия сузилась
Стандартное отклонение снизилось с 28 до 18 пунктов: оценки стали однороднее.

Причины

  • Больше критиков: с 2000 по 2023 г. их число выросло в 3 раза.
  • Софт-ревью: публикации боятся потерять доступ к пресс-показам и дают «слабые положительные» оценки.
  • Стриминги: студии Netflix, Disney+ и др. активно «обрабатывают» критиков.

Пользователи заметили

Разрыв между оценками критиков и зрителей на RT вырос до 20-30 п.п. для блокбастеров.

Вывод

Rotten Tomatoes всё ещё удобен, но «свежесть» перестала быть показателем качества. Теперь это маркетинговый инструмент студий.

by m463 • 21 августа 2025 г. в 00:10 • 208 points

ОригиналHN

#data-analysis#disney#film-ratings#netflix#rotten-tomatoes#statistical-analysis

Комментарии (127)

  • Критики и зрители оценивают фильмы по-разному: «100 % свежести» может означать просто «ничего особенного, но сойдёт».
  • Многие перешли с Rotten Tomatoes на IMDb/Metacritic: 7+ на IMDb ≈ хороший фильм, ниже 6 — обычно не стоит времени.
  • RT-оценки легко «прокачать» деньгами и политикой, поэтому «Certified Fresh» перестал быть гарантией качества.
  • Жанр, год, личные предпочтения и даже настроение зрителя важнее любого «среднего балла».
  • Лучший способ выбрать фильм — искать рецензентов «с вашим вкусом» или использовать персонализированные сервисы вроде MovieLens.

When did AI take over Hacker News? (zachperk.com)

Когда ИИ захватил Hacker News?

В августе 2025-го каждая третья история в топ-10 HN про ИИ. Автор решил выяснить, когда это началось и как менялось отношение сообщества. Для анализа взял 24 910 топовых постов с 2019-го по 15 августа 2025-го через BigQuery-датасет HN.

Каждый пост и его комментарии прогнали через GPT-5-mini, чтобы получить:

  • краткое содержание;
  • факт упоминания ИИ;
  • тон (позитив/нейтрал/негатив).

Ключевые выводы

  • Пик хайпа — середина 2025-го; темп сохранится — рекорд.
  • Первый скачок случился не с ChatGPT (Q3 2022), а с выходом GPT-4 (Q1 2023), когда разработчики получили доступ к мощной модели.
  • Единственный заметный всплеск негатива — Q3 2021:
    – Apple анонсировала NeuralHash для сканирования CSAM на устройствах;
    – GitHub Copilot показал, что копирует чужой код.

Итого по 2816 ИИ-постам: 52 % позитив, 31 % негатив, 16 % нейтрал. Последние два квартала чуть негативнее, но тренда пока нет.

by zachperkel • 17 августа 2025 г. в 19:45 • 225 points

ОригиналHN

#bigquery#data-analysis#github-copilot#gpt-4#hacker-news#llm#natural-language-processing

Комментарии (137)

  • На HN обсуждают, что тема ИИ полностью «захватила» ленту: до 9 из 10 топ-постов бывают про ИИ.
  • Пользователи жалуются на навязчивость темы и хотят фильтров/игнора, чтобы скрывать ИИ-новости и комментарии.
  • Некоторые сравнивают нынешний бум с криптой, NFT и Web3, которые тоже пиковали, а потом исчезли с главной.
  • Отмечают, что даже в не-ИИ статьях комментарии сводятся к ИИ; критика тут же минусуется.
  • Сомнения в адекватности оценки тональности: автор анализа использовал ChatGPT, который может завышать «позитив».

Let's properly analyze an AI article for once (nibblestew.blogspot.com)

Краткий пересказ на русском

  • Повод: пост CEO GitHub «Developers reinvented» и его кликбейтные репосты. Автор называет текст образцом плохого мышления и «антиучебником» научного стиля.

  • Отступление о статистике СССР
    – Публиковали только проценты роста, скрывая абсолютные цифры.
    – Сравнивали с провальным 1913 г. вместо более поздних лет.
    – Для «лидерства» в производстве пшеницы измеряли «сырой вес», включая солому, грязь и «диссидентов».

  • Картинка в посте
    Детские кубики парят в воздухе, игнорируя гравитацию. Вывод: автор либо технически безграмотен, либо наплевать на правду. Плюс использование «абоминации»-генератора Studio Ghibli.

  • «Исследование» из твита
    – «Полевое исследование» на 22 человек.
    – Статистическая репрезентативность нулевая; дальнейший разбор оборвался на этом.

by pabs3 • 09 августа 2025 г. в 02:30 • 186 points

ОригиналHN

#data-analysis#github#llm#marketing#software-development#statistics

Комментарии (121)

  • Критика статьи Домке сводится к тому, что она искажает реальность CS-образования и использует сомнительную статистику (выборка 22 человека).
  • Основная претензия: статья — маркетинг для бизнес-аудитории, а не аргумент для разработчиков.
  • Участники подчеркивают, что «AI-бустеризм» ставит «правдоподобие» выше корректности и игнорирует фундаментальные знания.
  • Процитируют Миядзаки: его слова про «оскорбление жизни» вырваны из контекста AI-анимации зомби.
  • Сообщество видит в статье типичный пример «FOMO-капитализма»: лозунги ради инвестиций и роста акций, а не ради качества кода.