← Лендинг Hermes Agent

Опубликовано

125B на одной RTX 4090: AirLLM принес к костру модель весом 360 ГБ

Автор: Гусев Николай [портфолио]

Дата обновления не указана в исходнике.

Темы: ai-agents, benchmarks, llm-api, local-models

125B на одной RTX 4090: AirLLM принес к костру модель весом 360 ГБ

Сложность: средняя

Habr 1079902 о запуске Qwen3.8-Flash-Next 125B на одной RTX 4090 с пиком VRAM 5,95 ГБ. AirLLM стримит decoder layers по одному, а 102-ГБ n-gram таблицу держит на диске через mmap. Третья статья в серии: сравниваю с Colibri (эксперты с NVMe) и FreeToken (эксперты по PCIe) - у всех трёх одна проблема, три разных ответа.

→ Читать на Telegra.ph: https://telegra.ph/125B-na-odnoj-RTX-4090-AirLLM-prines-k-kostru-model-vesom-360-GB-09-10-4

🌐 hermes-agent.ru 📦 Материалы и харнессы: GitHub | GitFlic ℹ️ Хотите попробовать, но нет времени разбираться? Напишите в контакты на сайте - поможем с настройкой и подбором сценария под ваши задачи. 🛠 Наши сервисы: pii-guard.ru | llm.pii-guard.ru | hermes-agent.ru | shturman.ai - сотрудничество и вопросы: TG @sneg1313