Квантизация и пиковые часы: почему вечером ИИ кажется тупее
Разбор технологии квантизации весов LLM и гипотезы о деградации моделей в пиковую нагрузку. Что задокументировано, а что - городская легенда.
Квантизация: как провайдеры моделей удешевляют инференс
Квантизация — снижение точности весов и вычислений модели: вместо FP16/FP32 считаем в INT8 или INT4. Модель занимает меньше памяти и выдаёт токены быстрее. Индустриальные оценки экономии вычислений при переходе на низкую точность — 60–75%. Качество падает измеримо, но умеренно при аккуратном применении: на INT8 обычно теряется 1–3% качества, на INT4 потери заметнее и сильно зависят от задачи.
Дальше — моя гипотеза:
Вечером по Москве в США начинается рабочий день, нагрузка на американские сервисы идёт в пик. Я допускаю, что в эти часы провайдеры могут подкручивать точность инференса, чтобы успевать обслуживать запросы, — и модели субъективно «тупеют». Ни Anthropic, ни OpenAI никогда такого не подтверждали. Идея давно ходит по Reddit, Twitter и Hacker News, технические издания называют её стойкой недоказанной теорией. Вполне возможно это городская легенда.
Что действительно задокументировано: у Anthropic ужесточаются usage-лимиты в пиковые часы буднего дня — 5:00–11:00 по тихоокеанскому времени, это примерно 15:00–21:00 по Москве. Речь про замедление, ограничение объёма запросов. Качество модели при этом они официально не трогают. Но именно из замедления, скорее всего, и растёт ощущение «вечером ИИ хуже»: упираешься в лимит, ждёшь — и записываешь всё это в деградацию.
Со стороны пользователя гипотезу не проверить: гонять одинаковые промпты в разное время суток бесполезно, разброс качества у LLM велик даже в одно время на одинаковых запросах.
#ИИ #инференс
Еженедельный дайджест
Лучшее из блогов менторов — раз в неделю
- разборы реальных бизнес-ситуаций
- управление, найм, продукт и продажи
- опыт основателей и практиков клуба
- новые материалы менторов за неделю