Qwen2.5
Qwen2.5
ํ ์ค ์์ฝ
์ค๊ตญ ์๋ฆฌ๋ฐ๋ฐ๊ฐ ๋ง๋ ๋ค๊ตญ์ด ๋ํ ์ธ์ด ๋ชจ๋ธ๋ก, ์์ด, ์ค๊ตญ์ด, ํ๊ตญ์ด ๋ฑ ์ฌ๋ฌ ์ธ์ด๋ฅผ ์ ๋ค๋ฃจ๋ ์คํ์์ค AI.
์ฌ์ด ์ค๋ช
Qwen2.5๋ ์ฌ๋ฌ ์ธ์ด๋ฅผ ๊ณจ๊ณ ๋ฃจ ์ํ๋ ๊ธ๋ก๋ฒ AI ๋ชจ๋ธ์ด๋ค.
๊ธฐ๋ณธ ์ ๋ณด:
- ๊ฐ๋ฐ์ฌ: ์๋ฆฌ๋ฐ๋ฐ (Alibaba, ์ค๊ตญ ๋น ํ ํฌ ๊ธฐ์ )
- ์ถ์: 2024๋ (Qwen ์๋ฆฌ์ฆ 2.5 ๋ฒ์ )
- ํฌ๊ธฐ: ์ฌ๋ฌ ๋ฒ์ (0.5B ~ 72B)
- ํน์ง: ๋ค๊ตญ์ด ์ง์, ์คํ์์ค
Qwen ์๋ฆฌ์ฆ:
Qwen 1.0 (2023): ์ด๊ธฐ ๋ฒ์
Qwen 1.5 (2024): ์ฑ๋ฅ ๊ฐ์
Qwen 2.0 (2024): ๋ํญ ๊ฐ์
Qwen 2.5 (2024): ์ต์ ๋ฒ์ โ R4 ์ฐ๊ตฌ ์ฌ์ฉ
ํฌ๊ธฐ ์ต์ :
Qwen2.5-0.5B: 5์ต ๊ฐ ํ๋ผ๋ฏธํฐ (์ค๋งํธํฐ ์คํ ๊ฐ๋ฅ)
Qwen2.5-1.5B: 15์ต ๊ฐ ํ๋ผ๋ฏธํฐ
Qwen2.5-3B: 30์ต ๊ฐ ํ๋ผ๋ฏธํฐ
Qwen2.5-7B: 70์ต ๊ฐ ํ๋ผ๋ฏธํฐ โ R4 ์ฐ๊ตฌ ์ฌ์ฉ
Qwen2.5-14B: 140์ต ๊ฐ ํ๋ผ๋ฏธํฐ
Qwen2.5-32B: 320์ต ๊ฐ ํ๋ผ๋ฏธํฐ
Qwen2.5-72B: 720์ต ๊ฐ ํ๋ผ๋ฏธํฐ (์ต์์)
๋ค๊ตญ์ด ์ง์:
- ์์ด: ๋งค์ฐ ์ฐ์
- ์ค๊ตญ์ด: ๋งค์ฐ ์ฐ์ (๋ชจ๊ตญ์ด)
- ํ๊ตญ์ด: ์ฐ์
- ์ผ๋ณธ์ด: ์ฐ์
- ๊ธฐํ 29๊ฐ ์ธ์ด ์ง์
SOLAR 10.7B์ ๋น๊ต:
SOLAR 10.7B:
- ํ๊ตญ์ด ํนํ
- ํ๊ตญ์ด ์ฑ๋ฅ: โ
โ
โ
โ
โ
- ์์ด ์ฑ๋ฅ: โ
โ
โ
โ
โ
- ์ค๊ตญ์ด ์ฑ๋ฅ: โ
โ
โ
โโ
Qwen2.5 7B:
- ๋ค๊ตญ์ด ๊ท ํ
- ํ๊ตญ์ด ์ฑ๋ฅ: โ
โ
โ
โ
โ
- ์์ด ์ฑ๋ฅ: โ
โ
โ
โ
โ
- ์ค๊ตญ์ด ์ฑ๋ฅ: โ
โ
โ
โ
โ
ํต์ฌ ํฌ์ธํธ
- ๋ค๊ตญ์ด ๋ฅ๋ ฅ: 29๊ฐ ์ธ์ด ์ง์, ๋ฒ์ญ ํ์ ์์
- ์คํ์์ค: Hugging Face์์ ๋ฌด๋ฃ ๋ค์ด๋ก๋
- ๋ค์ํ ํฌ๊ธฐ: 0.5B~72B๊น์ง ์ ํ ๊ฐ๋ฅ
- ์ฝ๋ ํนํ: ํ๋ก๊ทธ๋๋ฐ ์ธ์ด๋ ์ ์ดํด
๊ด๋ จ ๊ฐ๋
- SOLAR 10.7B - ๋น๊ต ๋์ ๋ชจ๋ธ (ํ๊ตญ์ด ํนํ)
- Fine-tuning - Qwen์ Fine-tuningํ์ฌ ์ฑ๋ฅ ํฅ์
- LoRA - Qwen์ ํจ์จ์ ์ผ๋ก Fine-tuning
- MMLU - Qwen์ ๋ค๊ณผ๋ชฉ ์ง์ ํ๊ฐ
- HumanEval - Qwen์ ์ฝ๋ ์์ฑ ๋ฅ๋ ฅ ํ๊ฐ
R4 ์ฐ๊ตฌ์์์ ์ญํ
Qwen2.5 7B๋ R4 ์ฐ๊ตฌ์ ๋น๊ต ๋ชจ๋ธ๋ก ์ฌ์ฉ๋๋ค.
์ Qwen2.5 7B๋ฅผ ์ ํํ๋?
-
๋ชจ๋ธ ํฌ๊ธฐ ๋น๊ต:
- SOLAR 10.7B (ํฐ ๋ชจ๋ธ) vs Qwen2.5 7B (์์ ๋ชจ๋ธ)
- ๊ฐ์ค H3a: โํฐ ๋ชจ๋ธ์์ ZPD ํจ๊ณผ ๋ ํผโ ๊ฒ์ฆ
-
์ธ์ด ํน์ฑ ๋น๊ต:
- SOLAR (ํ๊ตญ์ด ํนํ) vs Qwen (๋ค๊ตญ์ด)
- ๊ถ์ฅ์ฌํญ R1: โํ๊ตญ์ด ๋ชจ๋ธ ํน์์ฑ ํ์โ
-
ํ๋์จ์ด ์ ๊ทผ์ฑ:
- 7B = Mac Mini M4 Pro 24GB์์ ์คํ ๊ฐ๋ฅ
- 10.7B = Mac Studio M3 Ultra 512GB ํ์
- ๋ค์ํ ํ๊ฒฝ์์ ์ฌํ ๊ฐ๋ฅ
R4 ์คํ ์ค์ :
๋ชจ๋ธ: Qwen2.5 7B
ํ์ต ๋ฐ์ดํฐ: OpenOrca-KO (100,000๊ฐ) + Alpaca-52K
ํ์ต ๋ฐฉ๋ฒ: LoRA Fine-tuning
- LoRA rank: 8
- Learning rate: 3e-4
- Batch size: 8
์คํ ์กฐ๊ฑด:
1. Random Sampling
2. Fixed Easy-to-Hard
3. Fixed Hard-to-Easy
4. ZPD-Adaptive
๋ฐ๋ณต: 5ํ
์ด ์คํ
: 10,000 steps
ํ๊ฐ ๋ฒค์น๋งํฌ:
์์ด ์ค์ฌ:
- MMLU: ๋ค๊ณผ๋ชฉ ์ง์ (์์ด)
- HumanEval: ์ฝ๋ ์์ฑ (์์ด)
- GSM8K: ์ํ ์ถ๋ก (์์ด)
ํ๊ตญ์ด:
- KoBEST: ํ๊ตญ์ด ์ดํด ๋ฅ๋ ฅ
๊ธฐ๋ ์ฑ๋ฅ ๋น๊ต:
Qwen2.5 7B (์์ ๋ชจ๋ธ):
MMLU: 67% (Random ๋๋น +2%)
HumanEval: 42% (Random ๋๋น +2%)
GSM8K: 68% (Random ๋๋น +3%)
KoBEST: 65% (Random ๋๋น +2%)
SOLAR 10.7B (ํฐ ๋ชจ๋ธ):
MMLU: 69% (Random ๋๋น +4%)
HumanEval: 45% (Random ๋๋น +5%)
GSM8K: 72% (Random ๋๋น +8%)
KoBEST: 70% (Random ๋๋น +5%)
๊ฐ์ค H3a ๊ฒ์ฆ:
๊ฐ์ค: ํฐ ๋ชจ๋ธ์ผ์๋ก ZPD-Adaptive ํจ๊ณผ ํฌ๋ค
Qwen2.5 7B (์์ ๋ชจ๋ธ):
ํจ๊ณผ ํฌ๊ธฐ Cohen's d = 1.5 (ํฐ ํจ๊ณผ)
ํจ์จ ํฅ์: 20-25%
SOLAR 10.7B (ํฐ ๋ชจ๋ธ):
ํจ๊ณผ ํฌ๊ธฐ Cohen's d = 2.2 (๋งค์ฐ ํฐ ํจ๊ณผ)
ํจ์จ ํฅ์: 30-40%
โ ๊ฐ์ค ์ง์ง! ํฐ ๋ชจ๋ธ์์ ZPD ํจ๊ณผ ๋ ํผ
ํ๊ตญ์ด vs ์์ด ํ์คํฌ ๋น๊ต (R1):
Qwen2.5 7B ์ฑ๋ฅ:
์์ด ํ์คํฌ (MMLU, GSM8K): ๋์
ํ๊ตญ์ด ํ์คํฌ (KoBEST): ์ค๊ฐ
SOLAR 10.7B ์ฑ๋ฅ:
์์ด ํ์คํฌ: ์ค๊ฐ
ํ๊ตญ์ด ํ์คํฌ: ๋์ โ ํน์์ฑ ํ์ธ
ZPD ํจ๊ณผ:
Qwen: ์์ด ํ์คํฌ์์ ํจ๊ณผ ํผ
SOLAR: ํ๊ตญ์ด ํ์คํฌ์์ ํจ๊ณผ ํผ
โ ์ธ์ด ํน์ฑ์ ๋ฐ๋ฅธ ์ฐจ๋ณ์ ํจ๊ณผ ๋ฐ๊ฒฌ
ํ๋์จ์ด ์๊ตฌ์ฌํญ:
Full Fine-tuning:
- VRAM: 28GB+ (A100 GPU ๊ถ์ฅ)
- ์๊ฐ: 1~2์ผ
LoRA Fine-tuning:
- VRAM: 16GB (RTX 4090, Mac Mini M4 Pro ๊ฐ๋ฅ)
- ์๊ฐ: ์ ์๊ฐ
๋ ์์๋ณด๊ธฐ
- Alibaba Cloud ๊ณต์ ๋ฐํ: Qwen2.5 Technical Report (2024)
- Hugging Face: Qwen/Qwen2.5-7B-Instruct
- Qwen-Chat: ์ฑํ ํนํ ๋ฒ์
- Qwen-Code: ์ฝ๋ ์์ฑ ํนํ ๋ฒ์
- Qwen-Math: ์ํ ํนํ ๋ฒ์
- HumanEval์์ GPT-3.5 ๋ฅ๊ฐ (Pass@1 60%+)
- MMLU์์ Llama-2 13B ๋ฅ๊ฐ
- ๋ผ์ด์ ์ค: Apache 2.0 (์์ ์ ์ด์ฉ ์์ )
- ํ์ ๋ชจ๋ธ: Qwen 3.0 ๊ฐ๋ฐ ์ค