oMlx - лучший сервер для работы с локальными моделями на маках.
oMlx и раньше обгонял все остальные решения по количеству поддерживаемых технологий и совместимости с моделями, а теперь просто улетел в космос - 27t/s и 60 тысяч токенов контекста там, где пару недель назад было 17 и 40 соответственно.
Раньше могло работать что-то одно, а сейчас это починили. 60к контекста уже достаточно для работы небольшого кодового агента-джуна на маленьких моделях типа qwen3.5-9b. 25 t/s - минимально комфортный порог генерации для работы с агентом в реальном времени.
Я попробовал буквально все доступные инструменты для запуска моделей mlx, поэтому советую эту программу как самую производительную на данный момент.
Это только программы, за которыми я присматриваю, ещё десяток отсеял на этапе тестов