RL-Forgetting-Experiments-3/code-llama3p2_3b-replay-lam0p1 Reinforcement Learning • Updated 6 days ago
mradermacher/Qwopus3.8-27B-Flash-V2-abliterated-GGUF Text Generation • 27B • Updated 7 days ago • 1.93k • 2
agurung/cobalt-seeded-rl-base-ramp25-stoppen-gen4k-ep2-ncp5-n3n-groot16 Text Generation • 4B • Updated 5 days ago • 1.49k
agurung/cobalt-seeded-rl-base-ramp25-stoppen-gen4k-ep2-ncp5-n3nb-groot16 Text Generation • 4B • Updated 4 days ago • 701