Inference Providers
Active filters: rl
lithiumice/motion_imitation
Updated
tristan-deep/dqn-needle-tracker
Reinforcement Learning
• Updated • 1
tensorblock/archangel_sft-dpo_pythia2-8b-GGUF
tensorblock/archangel_sft_llama7b-GGUF
tensorblock/archangel_sft-kto_llama13b-GGUF
13B • Updated • 31
philschmid/qwen-2.5-3b-r1-countdown
Text Generation
• 3B • Updated • 9
• 8
Pinkstack/Superthoughts-lite-v1
Text Generation
• 2B • Updated • 101
• 3
mradermacher/Superthoughts-lite-v1-GGUF
2B • Updated • 42
• 1
mradermacher/Superthoughts-lite-v1-i1-GGUF
2B • Updated • 79
• 1
ayazfau/GPT2-124M-poetry-RL
Text Generation
• 0.1B • Updated • 11
• 2
mradermacher/GPT2-124-poetry-RLHF-GGUF
Text Generation
• 0.2B • Updated • 53
• 1
Pinkstack/Superthoughts-lite-v1-Q8-mlx
Text Generation
• 0.5B • Updated • 15
• 1
mradermacher/Superthoughts-mini-v1-3.8b-GGUF
4B • Updated • 90
mradermacher/Superthoughts-mini-v1-3.8b-i1-GGUF
4B • Updated • 125
AdvRahul/Axion-1.5B-Reasoning
2B • Updated • 4
prithivMLmods/Helix-Opus-14B-Exp
Text Generation
• 15B • Updated • 3
• 2
mradermacher/Quasar-3.0-Max-GGUF
8B • Updated • 20
mradermacher/Quasar-3.0-Max-i1-GGUF
8B • Updated • 6
mradermacher/Quasar-3.3-Max-GGUF
8B • Updated • 9
mradermacher/Quasar-3.3-Max-i1-GGUF
8B • Updated • 78
suayptalha/EmojiLlama-3.1-8B
Text Generation
• 8B • Updated • 12
• • 5
matrixportalx/EmojiLlama-3.1-8B-GGUF
Text Generation
• 8B • Updated • 8
mradermacher/EmojiLlama-3.1-8B-GGUF
8B • Updated • 106
• 1
mradermacher/Quasar-3.7-Coding-GGUF
8B • Updated • 290
mradermacher/Quasar-3.7-Coding-i1-GGUF
8B • Updated • 409
• 1
mradermacher/Quasar-3.7-GGUF
8B • Updated • 23
mradermacher/Quasar-3.7-i1-GGUF
8B • Updated • 259
tensorblock/EmojiLlama-3.1-8B-GGUF
Text Generation
• 8B • Updated • 10
tensorblock/Quasar-3.7-GGUF