https://huggingface.co/Qwen/Qwen3.8-27BВышла модель Qwen3.8-27B, которая по бенчмаркам лучше чем Opus 4.6 Читать далее
https://huggingface.co/Qwen/Qwen3.8-27B
Кратко:
Размер модели относительно небольшой, довольно быстро работает на карточках с 24+ GB VRAM.
"Понимает" изображения и видео
по некоторым бенчмаркам - лучше чем Opus 4.6
контекст: 262K, с помощью YARN можно увеличить до 1M

Так как большинство используют llama.cpp для запуска, то кванты можно взять вот тут:
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
Поддерживается MTP (спекулятивное предсказание)
Я тестировал на RTX 5090 (32GB VRAM).
Квант UD-Q6_K_XL:
помещается контекст только 48k
скорость генерации: 100 т/с
Квант UD-Q5_K_XL:
помещается контекст только 125k
скорость генерации: 120 т/с
Команда для запуска:
llama-server \
-hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \
--host 0.0.0.0 --port 8080 \
--fit off --gpu-layers all --gpu-layers-draft all \
--ctx-size 48000 \
--top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \
--spec-type draft-mtpЕсли вы запускаете на RTX 3090 / RTX 4090 (24GB VRAM), то вам надо будет брать квант поменьше и / или квантовать контекст и / или частично выгружать в обычную память.
Вот тут выложили специальный квант для запуска на карточках с 16GB VRAM:
https://huggingface.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF
Я этот квант не пробовал. Если кто попробует - отпишитесь к комментариях.
Что можно сделать, чтобы поместить побольше контекста на GPU?
квантизировать KV cache: --cache-type-k, --cache-type-v
Народ пишет что это может делать модель "тупее", особенно в кодинге. Я не пробовал.
не использовать MTP
Если убрать опцию –-spec-type draft-mtp, то при кванте UD-Q5_K_XL, помещается на 46k больше контекста.
При этом скорость генерации токенов становится в ~2 раза медленнее.
не использовать слой для работы с изображением. Его можно вообще не грузить: --no-mmproj, или грузить в обычную память вместо VRAM: --no-mmproj-offload.
При кванте UD-Q5_K_XL, помещается на 19k больше контекста.
В обычной памяти обработка изображений в 5 раз медленнее на процессоре с 16 ядрами и в 10 раз медленнее на процессоре в 8 ядрами. На скорость работы с текстом эти опции не влияют, - только на работу с изображениями. Например запрос с одним изображением обрабатывается 13 секунд на GPU, но 76 секунд на 16-ядерном AMD 9950x3d.
На RTX 5090 (32GB VRAM), при кванте UD-Q5_K_XL, без слоя для работы с изображениям, без MTP, помещается контекст 190k.
По личным ощущениям, качество модели очень хорошее, - модель стала заметно "умнее". Думаю, что на сегодня, это лучшая модель, которую с адекватной скоростью можно запустить у себя на компьютере.
В Docker можно запустить вот так:
services:
llama:
image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423
container_name: llama
devices:
- "nvidia.com/gpu=all"
ports:
- "8080:8080"
environment:
- NVIDIA_VISIBLE_DEVICES=all
- NVIDIA_DRIVER_CAPABILITIES=compute,utility
volumes:
- ~/.cache:/root/.cache
entrypoint: ["./llama-server"]
command: >
--host 0.0.0.0 --port 8080
--ctx-size 125000
--fit off --gpu-layers all --gpu-layers-draft all
-hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL
--spec-type draft-mtp
--top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0Цена
Интересно, что у самой Qwen это модель пока недоступна по API:
https://modelstudio.console.alibabacloud.com/ap-southeast-1
OpenRouter предлагает эту модель по довольно немаленькой цене: $0.45 / $3.20 per 1M:
https://openrouter.ai/qwen/qwen3.8-27b

Вот на этой одно-киловатной грелке работает у меня Qwen 3.8 27B на RTX 5090. Комната нагревается прям очень заметно.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Бесплатные API к Claude, GPT, DeepSeek и другим моделям: 6 AI-роутеров с бесплатным доступом | 0 | 10.92 | 16-08-2026 |
| 2 | Alibaba releases Qwen3.8-Max, challenging GPT-5.6 Sol and Claude Fable 5 on AI benchmarks | 0 | 21.32 | 03-08-2026 |
| 3 | Alibaba представила обновленную большую языковую модель Qwen3.8-Max | 0 | 13.96 | 03-08-2026 |
| 4 | Alibaba представила свою самую мощную ИИ-модель Qwen3.8-Max | 0 | 29.91 | 04-08-2026 |
| 5 | Alibaba выпустила новую версию чат-бота Qwen3.8-Max для конкурирования за лидерство в сфере ИИ с США | 0 | 15.44 | 04-08-2026 |
| 6 | Сравниваем ИИ‑модели для генерации игровых ассетов | 0 | 9.7 | 30-07-2026 |
| 7 | GigaChat 3.5 — меньше, быстрее, сильнее | 5 | 8 | 06-07-2026 |
| 8 | LLM как декодер в ASR: опыт адаптации SOTA архитектуры для спонтанной русскоязычной речи | 0 | 9.94 | 22-04-2026 |
| 9 | Как дообучить LLM. Рассказываю шаг за шагом | 0 | 8.7 | 08-06-2026 |
| 10 | Alibaba Cloud анонсировала ИИ-модель Qwen3-Max с 1 трлн параметров | 0 | 0 | 24-09-2025 |