M1 MacBook Air に MLX をインストールし、Mistral-7B-Instruct-v0.3-4bit(4bit量子化)を動かしました。MLX は Apple Silicon の Unified Memory アーキテクチャに最適化されており、外部 GPU なしでも効率的な推論が可能です。
検証環境
- MacBook Air / 16 GB Unified Memory
- macOS 15.x / Python 3.12
- MLX 0.31.2 / mlx-lm 0.31.2
実測結果
- モデルサイズ: 7.6 GB(4bit量子化)
- モデルロード時間: 91.4 秒
- 推論速度: 14.1 tokens/秒
- メモリ使用量: 3.8 GB
インストールは pip のコマンド一つで完了します。mlx-community が提供する量子化済みモデルを利用することで、HuggingFace からそのままダウンロードして動かせます。詳細は mlx-lm 公式リポジトリを参照してください。
推論速度 14.1 tokens/秒は、M1 MacBook Air の Unified Memory を活かした実力値です。メモリ使用量が 3.8 GB と効率的で、他のアプリと並行して動作させる余裕があります。
フィジカルAI分野では、ロボットや IoT デバイスの制御に LLM を組み合わせる事例が増えています。M1 Mac はその検証・プロトタイプ環境として手軽に使える選択肢です。
