Mac StudioでOllama・llama.cpp・MLXの速度を実測比較 — MLXはOllamaより38%速くメモリも3分の1、ただしOllamaのGGUFとllama.cppは同等だった
DRANK

9月20日、Terminal Bytesが「Ollama vs llama.cpp vs MLX on a Mac Studio, measured」と題した記事を公開した。この記事では、Mac Studio M3 UltraでOllama・llama.cpp・MLXの3つのLLM推論ランタイムを同一モデルで実測比較した結果が詳しく紹介されている。数値の差はそのまま「動くか動かないか」「APIが使えるか否か」という実用上の選択に直結する。

by @tf_official
Related Topics: AI Machine Learning Mac