Running local models is good now
Локальные модели теперь почти не уступают облачным в ежедневных задачах разработки. На M2‑Mac с 64 ГБ ОЗУ и 1 ТБ памяти я запускаю Mistral 7B, Gemma 3, OpenAI OSS‑20B, Qwen 3 MOE и другие варианты через llama.cpp, Ollama, LM Studio и Open WebUI. Раньше они были медленными и неточными, но с выходом GPT‑OSS я перестал проверять их ответы против API‑моделей, используя их как быстрый персонализированный поиск в Google.
С недавними релизами Gemma 4 я начал запускать агентные циклы локально: модель Gemma‑4‑12b‑qat в LM Studio дает около 75 % точности и скорости frontier‑моделей, позволяя рефакторить код, писать unit‑тесты и даже построить две‑топовую рекомендательную систему в Docker‑контейнере. Я ограничиваю доступ только к bash, а кеш ключ‑значения достигает 64 ГБ, но такие задачи, которые шесть месяцев назад были невозможны, теперь выполняются. Модель прошла квантование, сохранив почти ту же точность, но работая быстрее. Для безопасности каждый сеанс Pi запускаю в Docker, давая лишь права на оболочку. Эти простые, но персонализированные запросы, от рефакторинга до генерации тестов, показывают, что локальные модели уже могут заменить быстрый Google‑поиск в большинстве повседневных задач.