See https://huggingface.co/collections/allenai/tmax for original release models and datasets.
-
TMaxxx/qwen35-9b-dppo-hardened-prefilter
Reinforcement Learning • 9B • Updated • 32 -
TMaxxx/qwen-4b-dppo-hardened-prefilter-sc3
Reinforcement Learning • 4B • Updated • 27 -
TMaxxx/qwen-2b-dppo-hardened-prefilter-sc3
Reinforcement Learning • 2B • Updated • 37 -
TMaxxx/qwen-27b-dppo-hardened-prefilter-sc3
Reinforcement Learning • 2.65M • Updated • 32