【小ネタ】実は「同時推論」がお得?マルチエージェントでローカルLLMを回す時の生成速度の考え方【LM Studio】
- マルチエージェント構成で同時推論を行うと総スループットが向上する
- 同時処理数を増やすと総スループットは80 tok/sから236 tok/sに、1リクエスト当たりの生成速度は80 tok/sから59 tok/sに低下する
- 個別の生成速度は低下するが、総スループットを重視する場合は同時推論が効率的である
【小ネタ】実は「同時推論」がお得?マルチエージェントでローカルLLMを回す時の生成速度の考え方【LM Studio】|kei


