Перейти к содержимому

T5Gemma 2 Speculators

Диффузионные спекуляторы для encoder–decoder модели

T5Gemma 2 Speculators

Обучил DFlash, DFlare и DSpark для T5Gemma 2 1B–1B и подготовил отдельный плагин для их запуска в vLLM. Спекулятор предлагает блок токенов, а базовая модель проверяет его — так можно сократить число последовательных шагов генерации.

  • Speculative decoding
  • DFlash / DFlare / DSpark
  • vLLM

Что сделано

  • Адаптировал обучение в Speculators под T5Gemma 2 с извлечением скрытых состояний на лету. Обучение спекулятора вместе с замороженной базовой моделью помещается на одной RTX 5070 Ti 16 ГБ; смесь данных разделена на 90% train и 10% validation.
  • Обучил пятислойные Large-модели и трёхслойный DSpark Base. Плагин добавляет encoder–decoder attention, кеширование encoder K/V и CUDA Graph; на Hugging Face опубликованы веса, команды обучения, состояния оптимизатора, логи и бенчмарки.

Основные результаты

DSpark Large достиг 1.553× на HumanEval (BS1, K=7). DSpark Base — 1.467× на HumanEval и 1.399× на MBPP (BS4, K=7); при K=3 он дал ускорение на всех шести проверенных наборах при BS1 и BS4. DFlare Large достиг 1.222× на HumanEval (BS1, K=7), но часто замедлял генерацию; DFlash Large в этой серии замеров оказался медленнее базовой модели.

Скорость измерена в vLLM на RTX 5070 Ti 16 ГБ / WSL2, с greedy decoding, CUDA Graph и лимитом ответа 128 токенов. BS — число одновременных запросов, K — число предлагаемых токенов. Ускорение — отношение итоговых токенов/с к базовой модели в той же серии замеров. Base и Large измерялись отдельно; результат зависит от задачи и настроек.

Таблицы и условия замеров

Код обучения · точные коммиты

Оригинальные статьи