Существует распространенное мнение, что большие языковые модели (LLMs) являются 'черными ящиками': пользователи вводят запросы и получают ответы, часто полагаясь на fine-tuning или LoRA для улучшений. Однако мы выбрали другой путь. В предыдущей статье я показал, как подписи Schnorr/MuSig2 можно разбить на строгие аффинные инварианты, рассматривая их как математическую систему, а не как загадку. В этой работе мы сделали следующий шаг, интегрировав эту методологию в нейросеть.
Мы использовали локальный MLX-дистрибутив: gpt-oss-20b-TurboQuant-MLX-8bit, не обучая его заново. Вместо этого мы исследовали .safetensors на уровне квантованных кодов, создали детерминированный кэш калибровки и извлекли реальные активации BF16 с конкретных слоев. Мы свели задачу к локальной целочисленной оптимизации квантованных весов, реализовали безопасный патч прямо в модель и добавили smoke-check, чтобы проверить, совпадают ли наши математические вычисления с реальным временем выполнения MLX.
В результате мы получили пайплайн, в котором квантованный слой наблюдаем, его поведение измеримо, его можно локально корректировать. И что самое важное, мы можем подтвердить, что среда выполнения не вводит нас в заблуждение. Например, для router.weight мы достигли почти полного переноса улучшений на holdout, в то время как для q_proj система честно доказала, что без внешнего эталона патч не имеет смысла. Это открытие может оказаться даже более значимым.
