Robocikowo>ROBOCIKOWO
Qwen-2.5-1.5B-SimpleRL-Zoo

Qwen-2.5-1.5B-SimpleRL-Zoo

Qwen2.5-1.5B · SimpleRL-Zoo
Model 1.5B rozumowania: bazowy Qwen2.5-1.5B trenowany metodą „zero RL” (RLVR/GRPO) bez SFT, w ramach SimpleRL-Zoo HKUST NLP. Wzmocnione rozumowanie matematyczne.
🔬 Research✓ Publiczny dostęp⚖ Open sourceLLMModel rozumowania
Parametry
1.5B
parametrów
Data premiery
24 marca 2025
Dostęp:DownloadWdrożenie:💻 Lokalnie

Przegląd

Qwen-2.5-1.5B-SimpleRL-Zoo to model rozumowania powstały przez zastosowanie „zero reinforcement learning” bezpośrednio na bazowym modelu Qwen2.5-1.5B, bez wcześniejszego dostrajania instrukcyjnego (SFT). Powstał w projekcie SimpleRL-Zoo grupy HKUST NLP (kier. Junxian He).

SimpleRL-Zoo bada i „oswaja” zero-RL dla otwartych modeli bazowych „w praktyce”, stosując m.in. korektę nagrody za format oraz kontrolę trudności zapytań, by wzmocnić zdolności rozumowania. Badanie pokazało, że różne modele bazowe uczą się odmiennie, oraz po raz pierwszy zaobserwowało pojawienie się zachowań weryfikacyjnych („moment aha”) w małych modelach spoza rodziny Qwen.

Trening prowadzono z użyciem uczenia ze wzmocnieniem z weryfikowalnymi nagrodami (RLVR) i optymalizacji GRPO. Model oceniano na benchmarkach rozumowania matematycznego (AIME, MATH500, GSM8K). Wagi udostępniono na licencji Apache 2.0. Pracę zaprezentowano na COLM 2025 (arXiv:2503.18892).

Klasyfikacja
LLMModel rozumowania
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 1.5B
✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Parametry
1.5B
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Bazowy Qwen2.5-1.5B po treningu zero-RL (RLVR/GRPO), bez SFT.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie matematyczne
Zdolność modelu do rozwiązywania zadań matematycznych wymagających wieloetapowego rozumowania — równania, dowody, kombinatoryka, geometria, rachunek różniczkowy, zadania konkursowe.
Kategoria: reasoning
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language

Wyniki benchmarków

3 benchmarki
AIME
rozumowanie matematyczne
📄 paper
Ewaluacja wg publikacji SimpleRL-Zoo (COLM 2025).
MATH500
📄 paper
Ewaluacja wg publikacji SimpleRL-Zoo.
GSM8K
📄 paper
Ewaluacja wg publikacji SimpleRL-Zoo.

Architektura techniczna

Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)