Генерация изображений
Агент Гермеса последовательно обращается к текстовым запросам через FAL.ai. В коробке используются девять моделей, основанных на различных компромиссах по скорости, качеству и стоимости. Активная модель конфиденциальности пользователя через hermes Tools сохраняется в config.yaml.
Поддерживаемые модели
| Модель | Скорость | Сильные стороны | Цена |
|---|---|---|---|
fal-ai/flux-2/klein/9b (по умолчанию) |
<1c |
Быстро, чёткий текст | 0,006 долл. США/МП |
фал-ай/флюс-2-про |
~6с | Студийный фотореализм | 0,03 доллара США за МП |
fal-ai/z-image/turbo |
~2с | Двуязычный EN/CN, 6B параметры | 0,005 долл. США/МП |
фал-ай/нано-банан-про |
~8с | Gemini 3 Pro, глубина рассуждений, отрисовка текста | $0,15/изображение (1K) |
fal-ai/gpt-image-1.5 |
~15с | Следование запроса | $0,034/изображение |
fal-ai/gpt-image-2 |
~20с | Современная отрисовка текста + CJK, осознающий мир фотореализм | $0,04–$0,06/изображение |
fal-ai/ideogram/v3 |
~5с | Лучшая типографика | $0,03–$0,09/изображение |
fal-ai/recraft/v4/pro/text-to-image |
~8с | Дизайн, фирменные системы, надежность производства | $0,25/изображение |
fal-ai/qwen-image |
~12с | На основе LLM, сложный текст | 0,02 доллара США за МП |
Цены указаны на момент написания; актуальные цифры смотрите на fal.ai.
Настройка💡 Tip
Подписчики Nous
Если у вас есть платная подписка на Nous Portal, вы можете использовать генерацию изображений через Шлюз инструменты без API-переключателя FAL. Выбранная модель сохраняется в обоих путах.
Если управляемый шлюз подключается HTTP 4xx для конкретной модели, эта модель ещё не проксируется на стороне портала — агент сообщает вам об этом с активными исправлениями (установите FAL_KEY для прямого доступа или выберите другую модель).
Получить API-ключ FAL
- Зарегистрируйтесь на fal.ai
- Сгенерируйте API-ключ в панели управления.
Настройка и выбор модели
💡 Tip
Подписчики NousЕсли у вас есть платная подписка на Nous Portal, вы можете использовать генерацию изображений через Шлюз инструменты без API-переключателя FAL. Выбранная модель сохраняется в обоих путах.
Если управляемый шлюз подключается HTTP 4xx для конкретной модели, эта модель ещё не проксируется на стороне портала — агент сообщает вам об этом с активными исправлениями (установите FAL_KEY для прямого доступа или выберите другую модель).
Запустите командные инструменты:
hermes tools
Перейдите к 🎨 Генерация изображений, выберите бэкенд (Подписка Nous или FAL.ai), затем выберитещик покажет все применимые модели в таблице с мячом по столбцам — клавиатура со стрелками для навигации, Enter для выбора:
Model Скорость Сильные стороны Цена
fal-ai/flux-2/klein/9b <1с Быстро, чёткий текст $0.006/MP ← сейчас используется
fal-ai/flux-2-pro ~6с Студийный фотореализм $0.03/MP
fal-ai/z-image/turbo ~2с Двуязычный EN/CN, 6B $0.005/MP...
Ваш выбор сохраняется в config.yaml:
image_gen:
model: fal-ai/flux-2/klein/9b
use_gateway: false # true, если используется подписка Nous
Качество GPT-изображения
Запрос запроса для fal-ai/gpt-image-1.5 и fal-ai/gpt-image-2 фиксируется на уровне medium (~$0,034–$0,06/изображение при разрешении 1024×1024). Мы не выставляем уровни «низкий» / «высокий» в качестве пользовательской опции, чтобы биллинг Nous Portal оставался выгодным для всех пользователей — разброс стоимости между уровнями составляет 3–22×. Если вам нужен более дешёвый вариант, выберите Klein 9B или Z-Image Turbo; если нужно более высокое качество, воспользуйтесь Nano Banana Pro или Recraft V4 Pro.
Использование
Схема, видимая агенту, намеренно минимальна — модель использует то, что вы построили:
Сгенерируй изображение безмятежного горного пейзажа с цветущей сакурой
Создай квадратный портрет мудрой старой совы — используй модель с типографикой
Сделай мне футуристический городской пейзаж, альбомная ориентация
Соотношения стороны
Каждая модель принимает одни и те же три стороны с точки зрения агента. Внутренние спецификации собственного размера. Каждая модель автоматически монтируется:
| Ввод агента | image_size (flux/z-image/qwen/recraft/ideogram) | аспектное соотношение (нано-банан-про) | размер_изображения (gpt-image-1.5) | размер_изображения (gpt-изображение-2) |
|---|---|---|---|---|
пейзаж |
пейзаж_16_9 |
16:9 |
1536x1024 |
landscape_4_3 (1024×768) |
квадрат |
square_hd |
1:1 |
1024x1024 |
square_hd (1024×1024) |
портрет |
портрет_16_9 |
9:16 |
1024x1536 |
портрет_4_3 (768×1024) |
Изображение GPT 2 сопоставляется с пресетами 4:3, а не 16:9, потому что его минимальное количество размеров составляет 655 360 — пресет landscape_16_9 (1024×576 = 589 824) был отклонён.
Это преобразование происходит в _build_fal_payload() — агент кода никогда не должен знать о различиях в схеме между моделями.
Автоматическое масштабирование
Масштабирование через Clarity Upscaler от FAL включается для каждой модели отдельно:
| Модель | Масштабирование? | Почему |
|---|---|---|
фал-ай/флюс-2-про |
✓ | Обратная связь (было значение при выборе модели) |
| Все остальные | ✗ | Быстрые модели потеряли ценность субсекундного отклика; модели высокого разрешения ему не нужны |
При масштабировании результатов используйте следующие настройки:
| Настройка | Значение |
|---|---|
| Коэффициент масштабирования | 2× |
| Креативность | 0,35 |
| Соответствие | 0,6 |
| Шкала руководство | 4 |
| Шагов вывода | 18 |
Если масштабирование не удалось (сетевая проблема, ограничение скорости), автоматически возвращается исходное изображение.
Как это работает внутри
- Определение модели —
_resolve_fal_model()читаетimage_gen.modelизconfig.yaml, затем из переменного окруженияFAL_IMAGE_MODEL, затем используетfal-ai/flux-2/klein/9b. - Построение нагрузки —
_build_fal_payload()преобразует вашеaspect_ratioв родной формат модели (перечисление пресетов, перечисление соотношений стороны или литерал GPT), параметры модели по умолчанию, документирует любые переопределения вызывающей стороны, затем фильтрует по белому спискуподдержекмодели, чтобы неподдерживаемые ключи никогда не отправлялись. - Отправка —
_submit_fal_request()направляет через прямые учётные данные FAL или управляемый шлюз Nous. - Маштабирование — показатель, только если метаданные модели имеют
upscale: True. - Доставка — финальный URL-изображение возвращается агенту, который последовательно тег
MEDIA:<url>, преобразуемый адаптерами платформы в нативное медиа.
Отладка
Включите отладочное логирование:
export IMAGE_TOOLS_DEBUG=true
Отладочные логи отображаются в ./logs/image_tools_debug_<session_id>.json с деталями каждого вызова (модель, параметры, время, ошибки).
Доставка на платформах
| Платформа | Доставка |
|---|---|
| CLI | URL-изображение выводится как уценка  — нажмите, чтобы открыть |
| Телеграмма | Сообщение с фото и запросом как Подписываю |
| Раздор | Встроено в сообщение |
| Слабость | URL разворачивается Slack |
| Медиасообщение | |
| Другие | URL в виде обычного текста |
Ограничения
- Требуются учётные данные FAL (прямой
FAL_KEYили подписка Nous) - Только текст на изображении — нет инпейнтинга, img2img или редактирования через этот инструмент
- Временные URL — FAL возвращает размещённые URL, которые истекают через часы/дни; сохраняйте локально, если нужно
- Ограничения каждой модели — некоторые модели не содержат
seed,num_inference_stepsи т.д. Фильтрподдерживаетмолча отбрасывает неподдерживаемые параметры; это ожидаемое поведение