oMlx - лучший сервер для работы с локальными моделями на маках.

oMlx и раньше обгонял все остальные решения по количеству поддерживаемых технологий и совместимости с моделями, а теперь просто улетел в космос - 27t/s и 60 тысяч токенов контекста там, где пару недель назад было 17 и 40 соответственно.

oMlx - лучший сервер для работы с локальными моделями на маках.

Раньше могло работать что-то одно, а сейчас это починили. 60к контекста уже достаточно для работы небольшого кодового агента-джуна на маленьких моделях типа qwen3.5-9b. 25 t/s - минимально комфортный порог генерации для работы с агентом в реальном времени.

Я попробовал буквально все доступные инструменты для запуска моделей mlx, поэтому советую эту программу как самую производительную на данный момент.

Это только программы, за которыми я присматриваю, ещё десяток отсеял на этапе тестов
Это только программы, за которыми я присматриваю, ещё десяток отсеял на этапе тестов
2
1