はじめに transformerとtext_encoderをSDNQ(SD.Next Quantization)で4bit量子化しました。 torchao、bitsandbytesでもやってみましたが、4bit量子化は実行できても実際にモデルを実行する時にgroup_offloadingのところで躓いてうまくできませんでした。 環境…
引用をストックしました
引用するにはまずログインしてください
引用をストックできませんでした。再度お試しください
限定公開記事のため引用できません。