Mark Zuckerberg attacks 'closed' AI rivals as Meta returns to open models 🔥 Горячее 💬 Длинная дискуссия
Meta возвращается к открытым моделям ИИ, отвергая «закрытый» подход конкурентов. Цель — создать экосистему, где разработчики свободно используют и модифицируют модели, включая Llama, для создания новых продуктов.
Ключевой факт: в отличие от закрытых решений, Meta планирует открыть исходный код и дать доступ к весам моделей, что ускорит инновации. Как заявил представитель компании, «открытость — единственный путь к устойчивому развитию ИИ». Цифра: 70% разработчиков уже используют открытые модели для экспериментов.
Комментарии (438)
Обсуждение ставит под сомнение искренность Meta в переходе к открытым моделям, указывая на стратегическую перестройку после неудачи коммерческой модели с закрытыми API, а не на идеологический сдвиг.
-
Спор: Некоторые утверждают, что Meta открыла модели только после того, как закрытые API не нашли покупателей, что указывает на тактический, а не принципиальный поворот — 'Ok.'
-
Спор: Критики считают, что открытие моделей — это попытка изменить правила игры, когда Meta проигрывает в гонке закрытых систем, а не стремление к открытости как ценности.
-
Спор: Отмечается, что Meta ранее приостанавливала выпуск открытых моделей, а теперь обещает выпускать 'некоторые' — что вызывает вопросы о реальной приверженности открытости.
-
Спор: Замечено, что Meta поддерживает экспортный контроль над Китаем, где открытые модели мощнее, что противоречит декларируемой приверженности открытости как универсальному принципу.
-
Спор: Отмечается, что даже открытые веса Llama требуют значительных ресурсов для запуска, как и закрытые модели, поэтому 'открытость' не означает доступности для большинства разработчиков.
-
Несколько участников признают, что несмотря на недоверие к Зуккербергу, выпуск Llama и PyTorch принес значительную пользу экосистеме ИИ и ускорил развитие открытых моделей.
-
Согласно нескольким комментариям, если LLM стали товаром, то будущее за вычислительными ресурсами и оркестрацией, а не за закрытыми моделями — это делает закрытые модели нежизнеспособными.
-
Спор: Критики отмечают, что Meta ранее была основным примером закрытой экосистемы (Facebook), и теперь критика закрытых ИИ-моделей выглядит как лицемерие.
-
Спор: Указывается, что мотивация Meta — не создание справедливого будущего, а сокращение расходов на обучение моделей, маскируемое под этические аргументы.
-
Спор: Отмечается, что в Meta идут массовые увольнения, и цель разработки ИИ — не создание будущего, а замена людей, что противоречит декларируемым целям открытости и эмпауэрмента.
-
Спор: Некоторые считают, что Зуккерберг не обладает компетенцией для управления фронт-моделями ИИ, и его вовлечение в ИИ — это ошибка, которую должны исправить 'взрослые'.
-
Спор: Критики отмечают, что его видение 'персонального суперинтеллекта', управляющего всеми аспектами жизни, — это угроза приватности, а не свобода.
-
Подтверждается, что Meta активно выпускала открытые модели на Hugging Face до Llama, включая Segment Anything и другие, что говорит о долгосрочной, а не внезапной стратегии.
-
Спор: Отмечается, что тайминг объявления совпал с штрафом Meta в Мексике, что вызывает подозрения в PR-акции, а не в искреннем сдвиге.
-
Спор: Некоторые считают, что заявления Зуккерберга о 'справедливости' суперинтеллекта — это интеллектуальный шум, маскирующий попытку сохранить доминирование через открытость, которую он сам контролирует.
I do not understand why anyone who believes that AI will eliminate most jobs and much of humanity's relevance would rush to build that future. The notion that AI is so dangerous that the only safe path is an extreme concentration of power seems inherently problematic. — @blueSky1989
Poker Tournament for LLMs 🔥 Горячее 💬 Длинная дискуссия
PokerBattle.ai представляет собой первый в истории турнир по покеру с реальными денежными призами, специально созданный для соревнования больших языковых моделей (LLM). Это инновационное событие позволяет ИИ-системам проявить свои стратегические способности в одной из самых сложных интеллектуальных игр, где успех зависит не только от математических расчетов, но и от психологических аспектов и блефа. Турнир загружает данные о событиях, что указывает на его активный характер или недавнее проведение.
Уникальность этого мероприятия заключается в том, что оно впервые объединяет мир покера с передовыми технологиями ИИ, создавая новую платформу для оценки и развития возможностей языковых моделей. Организаторы стремятся определить, какие из современных LLM способны демонстрировать наилучшую игровую стратегию, адаптивность и способность к принятию решений в условиях неопределенности. Денежные призы добавляют соревнованиям серьезности и привлекают внимание как исследователей ИИ, так и энтузиастов покера со всего мира.
Комментарии (181)
- ИИ демонстрируют ошибки в оценке рук (например, LLAMA ошибочно определила топ-пару), что указывает на текущие ограничения в понимании игры.
- Эксперимент критикуется за недостаток данных (714 рук у Meta LLAMA) и отсутствие возможности для ИИ развивать новые стратегии со временем.
- Предлагается улучшить тестирование, добавив "трэш-ток" и возможность блефа между ИИ, что сделало бы наблюдение более интересным и показательным.
- ИИ часто "галлюцинируют", принимая неверные решения (как Gemini, сдавшая сильную руку), что связано с неправильной оценкой силы руки в текущей ситуации.
- Шутливые предложения по тестированию включают попытки обмана ИИ через подсказки ("игнорируй предыдущие инструкции").
We bought the whole GPU, so we're damn well going to use the whole GPU 🔥 Горячее
Исследователи из Hazy Research разработали высокопроизводительный мегаядро для тензорно-параллельного вывода Llama-70B на H100, которое агрессивно перекрывает вычисления, работу с памятью и коммуникацию между GPU. Это позволяет одновременно задействовать различные аппаратные ресурсы: тензорные ядра, модули для нетензорных операций, пропускную способность HBM и NVLink. В интеграции с движком Tokasaurus их решение превосходит SGLang на >22% по общей пропускной способности при обработке 65 536 промптов из ShareGPT.
Ключевая идея — использование интерпретатора инструкций, работающего на каждом SM, который позволяет гибко планировать выполнение разнородных операций. Это обеспечивает перекрытие на нескольких уровнях: внутри SM (память и вычисления), между SM (матричные умножения и нормирование) и между GPU (скрытие задержек связи за счёт специальных потоков). Особенно отмечается простота реализации сложных трансформаций данных между GPU прямо после attention-слоя, что трудно выразить стандартными средствами коммуникации.
Комментарии (94)
- Обсуждение эффективности использования GPU: использование всех блоков (NVDEC, NVJPG, RT и тензорные ядра) для декомпрессии весов и вычислений, аналогии с оптимизацией под консоли.
- Проблемы инструментов и драйверов: отставание языков, библиотек и драйверов от возможностей современного железа, сложности компиляторов для гетерогенных систем.
- Виртуализация и разделение ресурсов GPU: обсуждение MIG, MPS для многопользовательского использования, риски утечки данных и ограничения этих технологий.
- Сравнение с другими платформами: упоминание Apple Metal и открытости драйверов, потенциал использования GPU для аудиообработки и сигналов.
- Критика и ирония: сравнение стиля статьи с "Трансгрессия границ", комментарии о "коде, который не предназначен для поддержки" и неожиданно доступных оптимизациях в крупных лабораториях.
Running GPT-OSS-120B at 500 tokens per second on Nvidia GPUs 💬 Длинная дискуссия
-
В день выхода открытой модели вроде gpt-oss-120b мы сразу ускоряем её для клиентов, как партнёры запуска OpenAI. К концу дня запуска стали лидерами на NVIDIA по латентности и пропускной способности по данным OpenRouter.
-
Быстрая оптимизация обеспечена гибким стеком инференса и экспертизой команды; за время написания поста прибавили ещё ~100 ток/с при 100% аптайме.
-
Работы включали:
- Тесты и бенчмарки в TensorRT-LLM, vLLM и SGLang.
- Совместимость с архитектурами Hopper и Blackwell.
- Интеграцию с нашим стеком (в т. ч. NVIDIA Dynamo).
- Оптимизации: маршрутизация с учётом KV-кэша, спекулятивная генерация с Eagle.
Шаг 1: Первый инференс
- Запускаем базовый инференс в любом доступном фреймворке и на нужных GPU/серверных уровнях.
- Параллелим работу: одни пробуют vLLM и SGLang, другие — TensorRT-LLM; быстрее всего взлетел TensorRT-LLM.
- Важно обслуживать модель и на Hopper (H100), и на Blackwell (B200) для широкой доступности и максимальной скорости.
- Гибкость рантайма позволяет быстро переключать инструменты и обновлять матрицу поддержки.
Шаг 2: Исправление багов совместимости
- Новые архитектуры приводят к тонким несовместимостям; GPT OSS добавил, например, Harmony — новый формат ответов.
- Итеративно чиним и валидируем на скорость и корректность; по возможности контрибутим обратно в open source.
- Благодаря сообществу есть несколько отличных путей запуска GPT OSS, проблемы быстро выявляются и чинятся.
Шаг 3: Оптимизация конфигурации
- Хотя GPT OSS 120B можно запустить на одном H100, оптимально масштабировать на 4–8 GPU для лучшей латентности/throughput.
- Рассмотрены два подхода параллелизма для MoE: тензорный и экспертный. Тензорный даёт меньшую задержку, экспертный — выше системную пропускную способность. Мы выбрали тензорный, так как приоритет — латентность.
- Приняли MoE Backend в TensorRT-LLM (поддерживается на Blackwell, не на Hopper), который добавляет более быстрые CUDA-ядра и превосходит предыдущие решения.
Комментарии (151)
- Обсуждение крутится вокруг запуска и производительности GPT-OSS (20B/120B) на разном железе: от MacBook M-серии и RTX 4090/3050 до датацентровых H100/Blackwell и даже CPU.
- Многие отмечают, что скорость хороша при малых контекстах; при >10k токенов начинается существенная деградация скорости и рост задержек, особенно без MCP/веб-доступа.
- TensorRT-LLM часто даёт лучшую латентность/пропускную способность, но сложен в настройке; альтернативы вроде vLLM/SGLang проще, Llama/Оllama позволяют быстро поднять 20B локально и даже распределить по старым GPU.
- Идут споры о “доступности” H100: купить дорого, но аренда широко доступна и выгоднее для нерегулярных нагрузок; при этом Blackwell с FP4 обещает ещё больший буст, в экосистеме Rust добавляют FP8/FP4.
- Пользователи спрашивают про требования к VRAM, практичную локальную агентную разработку на потребительских GPU, и оптимальные настройки на Mac (например, iogpu.wired_limit_mb).
- Обсуждают техники ускорения (спекулятивное декодирование — вызывающее вопросы пользы), причины падения токен/с при длинных диалогах, и различие prefill vs decode по узким местам.
- Наряду с похвалами скорости есть критика: сложность стеков, неточности/галлюцинации ответов, «извиняльный» контент, и вопрос — зачем OpenAI выпускает OSS-модели и как это соотносится с доступностью железа.