GPU 演算リソースのハードウェア計画
GPU における Llama3 の推論速度(token/秒)

GPU
メモリ(VRAM)
8B Q4_K_M
8B F16
70B Q4_K_M
70B F16
Llama3 モデルが必要とする VRAM
モデル
Q4_K_M(量子化後)
F16(オリジナル)
ハードウェア構成の推奨
名称
VRAM
Last updated
Was this helpful?
