inference-optimization/Qwen3-235B-A22B-Instruct-2507-quantized.w4a16 Text Generation • 32B • Updated May 20 • 17
inference-optimization/Qwen3-235B-A22B-Thinking-2507-quantized.w4a16 Text Generation • 32B • Updated May 20 • 7
inference-optimization/Qwen3-235B-A22B-Thinking-2507-quantized.w8a8 Text Generation • 235B • Updated May 20 • 10
RedHatAI/NVIDIA-Nemotron-3-Ultra-550B-A55B-FP8-dynamic Text Generation • 561B • Updated 16 days ago • 3.97k • 1
RedHatAI/NVIDIA-Nemotron-3-Ultra-550B-A55B-quantized.w4a16 Text Generation • 565B • Updated 16 days ago • 1.08k • 3
nwzjk/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16-W4A16-G128 Text Generation • 565B • Updated Jun 8 • 18 • 1