Q8 KV-кеш с rotation теряет 0,8% точности, но замедляет генерацию в 3–8 раз TurboQuant от Google Research показал 37,1% на AIME25 против 37,9% у F16 — практически без потерь качества. Но текущие реализации замедляют inference в 3–8 раз из-за неоптимизированной операции rotation. Сообщество тестирует алгоритм неделю — вот что выяснилось про компромиссы между памятью и скоростью. Кто тестировал и на чём Независимые бенчмарки провело сообщество r/LocalLLaMA через неделю после публикации статьи (при…