q1716523669/mllm-cogrpo-heter-internvl35-2b-x-gemma3-4b-mmr1-groupB-gemma3-4b 769k • Updated 3 days ago • 13
q1716523669/mllm-cogrpo-heter-qwen25vl-3b-x-gemma3-4b-mmr1-groupB-gemma3-4b 769k • Updated 3 days ago • 47
q1716523669/mllm-cogrpo-heter-qwen25vl-3b-x-gemma3-4b-mmr1-groupA-qwen25vl-3b 756k • Updated 3 days ago • 14
q1716523669/mllm-cogrpo-heter-qwen25vl-3b-x-gemma3-4b-openr1-groupB-gemma3-4b 769k • Updated 3 days ago • 17
q1716523669/mllm-cogrpo-heter-qwen25vl-3b-x-gemma3-4b-openr1-groupA-qwen25vl-3b 756k • Updated 3 days ago • 15
q1716523669/mllm-cogrpo-heter-internvl35-2b-x-gemma3-4b-openr1-groupB-gemma3-4b 769k • Updated 3 days ago • 17
q1716523669/cogrpo-homo-llama31-8b-math345-groupB-llama31-8b-b-end Reinforcement Learning • 266k • Updated 6 days ago • 11
q1716523669/cogrpo-homo-llama31-8b-math345-groupB-llama31-8b-b-best Reinforcement Learning • 266k • Updated 6 days ago • 12
q1716523669/cogrpo-homo-llama31-8b-math345-groupA-llama31-8b-a-end Reinforcement Learning • 266k • Updated 6 days ago • 12
q1716523669/cogrpo-homo-llama31-8b-math345-groupA-llama31-8b-a-best Reinforcement Learning • 266k • Updated 6 days ago • 14
q1716523669/mllm-mmr1-gt-internvl35-2b-full-end-s722 Reinforcement Learning • 2B • Updated 6 days ago • 11
q1716523669/mllm-mmr1-gt-internvl35-2b-full-best-s440 Reinforcement Learning • 2B • Updated 6 days ago • 12
q1716523669/cogrpo-w2s-qwen25-3b-x-qwen25-7b-math345-groupB-qwen25-7b-end Reinforcement Learning • 333k • Updated 7 days ago • 15 • 1
q1716523669/cogrpo-w2s-qwen25-3b-x-qwen25-7b-math345-groupB-qwen25-7b-best Reinforcement Learning • 333k • Updated 7 days ago • 13
q1716523669/cogrpo-w2s-qwen25-3b-x-qwen25-7b-math345-groupA-qwen25-3b-end Reinforcement Learning • 242k • Updated 7 days ago • 17
q1716523669/cogrpo-w2s-qwen25-3b-x-qwen25-7b-math345-groupA-qwen25-3b-best Reinforcement Learning • 242k • Updated 7 days ago • 14
q1716523669/cogrpo-n3-strict-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupC-qwen3-end Reinforcement Learning • 2B • Updated 7 days ago • 9
q1716523669/cogrpo-n3-strict-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupC-qwen3-best Reinforcement Learning • 2B • Updated 7 days ago • 14 • 1
q1716523669/cogrpo-n3-strict-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupB-llama32-end Reinforcement Learning • 175k • Updated 7 days ago • 11 • 1
q1716523669/cogrpo-n3-strict-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupB-llama32-best Reinforcement Learning • 175k • Updated 7 days ago • 13
q1716523669/cogrpo-n3-strict-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupA-qwen25-end Reinforcement Learning • 242k • Updated 7 days ago • 10 • 1
q1716523669/cogrpo-n3-strict-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupA-qwen25-best Reinforcement Learning • 242k • Updated 7 days ago • 12
q1716523669/cogrpo-n3-ring-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupC-qwen3-end Reinforcement Learning • 2B • Updated 8 days ago • 15
q1716523669/cogrpo-n3-ring-qwen25-3b-x-llama32-3b-x-qwen3-1p7b-math345-groupC-qwen3-best Reinforcement Learning • 2B • Updated 8 days ago • 45