Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Вышла новая модель: Qwen 3.8 27B

Дата публикации: 14-08-2026 19:42:35

https://huggingface.co/Qwen/Qwen3.8-27BВышла модель Qwen3.8-27B, которая по бенчмаркам лучше чем Opus 4.6 Читать далее

Основное содержимое страницы с новостью.

https://huggingface.co/Qwen/Qwen3.8-27B

Кратко:

  • Размер модели относительно небольшой, довольно быстро работает на карточках с 24+ GB VRAM.

  • "Понимает" изображения и видео

  • по некоторым бенчмаркам - лучше чем Opus 4.6

  • контекст: 262K, с помощью YARN можно увеличить до 1M

1af5a9d23bb6e69dae45ebafc9023973.png

Так как большинство используют llama.cpp для запуска, то кванты можно взять вот тут:

https://huggingface.co/unsloth/Qwen3.8-27B-GGUF

Поддерживается MTP (спекулятивное предсказание)

Я тестировал на RTX 5090 (32GB VRAM).

Квант UD-Q6_K_XL:

  • помещается контекст только 48k

  • скорость генерации: 100 т/с

Квант UD-Q5_K_XL:

  • помещается контекст только 125k

  • скорость генерации: 120 т/с

Команда для запуска:

llama-server \
 -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \
 --host 0.0.0.0  --port 8080 \
 --fit off --gpu-layers all --gpu-layers-draft all \
 --ctx-size 48000 \
 --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \
 --spec-type draft-mtp

Если вы запускаете на RTX 3090 / RTX 4090 (24GB VRAM), то вам надо будет брать квант поменьше и / или квантовать контекст и / или частично выгружать в обычную память.

Вот тут выложили специальный квант для запуска на карточках с 16GB VRAM:
https://huggingface.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF
Я этот квант не пробовал. Если кто попробует - отпишитесь к комментариях.

Что можно сделать, чтобы поместить побольше контекста на GPU?

  • квантизировать KV cache: --cache-type-k, --cache-type-v
    Народ пишет что это может делать модель "тупее", особенно в кодинге. Я не пробовал.

  • не использовать MTP
    Если убрать опцию –-spec-type draft-mtp, то при кванте UD-Q5_K_XL, помещается на 46k больше контекста.
    При этом скорость генерации токенов становится в ~2 раза медленнее.

  • не использовать слой для работы с изображением. Его можно вообще не грузить: --no-mmproj, или грузить в обычную память вместо VRAM: --no-mmproj-offload.
    При кванте UD-Q5_K_XL, помещается на 19k больше контекста.
    В обычной памяти обработка изображений в 5 раз медленнее на процессоре с 16 ядрами и в 10 раз медленнее на процессоре в 8 ядрами. На скорость работы с текстом эти опции не влияют, - только на работу с изображениями. Например запрос с одним изображением обрабатывается 13 секунд на GPU, но 76 секунд на 16-ядерном AMD 9950x3d.

На RTX 5090 (32GB VRAM), при кванте UD-Q5_K_XL, без слоя для работы с изображениям, без MTP, помещается контекст 190k.

По личным ощущениям, качество модели очень хорошее, - модель стала заметно "умнее". Думаю, что на сегодня, это лучшая модель, которую с адекватной скоростью можно запустить у себя на компьютере.

В Docker можно запустить вот так:

services:
  llama:
    image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423
    container_name: llama
    devices:
      - "nvidia.com/gpu=all"
    ports:
      - "8080:8080"
    environment:
      - NVIDIA_VISIBLE_DEVICES=all
      - NVIDIA_DRIVER_CAPABILITIES=compute,utility
    volumes:
      - ~/.cache:/root/.cache
    entrypoint: ["./llama-server"]
    command: >
      --host 0.0.0.0  --port 8080
      --ctx-size 125000
      --fit off --gpu-layers all --gpu-layers-draft all
      -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL
      --spec-type draft-mtp
      --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0

Цена

Интересно, что у самой Qwen это модель пока недоступна по API:
https://modelstudio.console.alibabacloud.com/ap-southeast-1

OpenRouter предлагает эту модель по довольно немаленькой цене: $0.45 / $3.20 per 1M:
https://openrouter.ai/qwen/qwen3.8-27b

Вот на этой одно-киловатной грелке работает у меня Qwen 3.8 27B на RTX 5090. Комната нагревается прям очень заметно.

Вот на этой одно-киловатной грелке работает у меня Qwen 3.8 27B на RTX 5090. Комната нагревается прям очень заметно.

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Бесплатные API к Claude, GPT, DeepSeek и другим моделям: 6 AI-роутеров с бесплатным доступом010.9216-08-2026
2Alibaba releases Qwen3.8-Max, challenging GPT-5.6 Sol and Claude Fable 5 on AI benchmarks021.3203-08-2026
3Alibaba представила обновленную большую языковую модель Qwen3.8-Max013.9603-08-2026
4Alibaba представила свою самую мощную ИИ-модель Qwen3.8-Max029.9104-08-2026
5Alibaba выпустила новую версию чат-бота Qwen3.8-Max для конкурирования за лидерство в сфере ИИ с США015.4404-08-2026
6Сравниваем ИИ‑модели для генерации игровых ассетов09.730-07-2026
7GigaChat 3.5 — меньше, быстрее, сильнее5806-07-2026
8LLM как декодер в ASR: опыт адаптации SOTA архитектуры для спонтанной русскоязычной речи09.9422-04-2026
9Как дообучить LLM. Рассказываю шаг за шагом08.708-06-2026
10Alibaba Cloud анонсировала ИИ-модель Qwen3-Max с 1 трлн параметров0024-09-2025

Классификация: Пресс-релизы. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 16.9. Источник: habr.com.