T5Gemma 2 Speculators
Диффузионные спекуляторы для encoder–decoder модели
T5Gemma 2 Speculators
Обучил DFlash, DFlare и DSpark для T5Gemma 2 1B–1B и подготовил отдельный плагин для их запуска в vLLM. Спекулятор предлагает блок токенов, а базовая модель проверяет его — так можно сократить число последовательных шагов генерации.
Что сделано
- Адаптировал обучение в Speculators под T5Gemma 2 с извлечением скрытых состояний на лету. Обучение спекулятора вместе с замороженной базовой моделью помещается на одной RTX 5070 Ti 16 ГБ; смесь данных разделена на 90% train и 10% validation.
- Обучил пятислойные Large-модели и трёхслойный DSpark Base. Плагин добавляет encoder–decoder attention, кеширование encoder K/V и CUDA Graph; на Hugging Face опубликованы веса, команды обучения, состояния оптимизатора, логи и бенчмарки.
Основные результаты
DSpark Large достиг 1.553× на HumanEval (BS1, K=7). DSpark Base — 1.467× на HumanEval и 1.399× на MBPP (BS4, K=7); при K=3 он дал ускорение на всех шести проверенных наборах при BS1 и BS4. DFlare Large достиг 1.222× на HumanEval (BS1, K=7), но часто замедлял генерацию; DFlash Large в этой серии замеров оказался медленнее базовой модели.
Скорость измерена в vLLM на RTX 5070 Ti 16 ГБ / WSL2, с greedy decoding, CUDA Graph и лимитом ответа 128 токенов. BS — число одновременных запросов, K — число предлагаемых токенов. Ускорение — отношение итоговых токенов/с к базовой модели в той же серии замеров. Base и Large измерялись отдельно; результат зависит от задачи и настроек.
Таблицы и условия замеров
Код обучения · точные коммиты
- DFlash / DFlare / DSpark Large: Speculators @ a58573ac
- DSpark Base: Speculators @ 4bd884b2
Оригинальные статьи