MMLU
MMLU
ํ ์ค ์์ฝ
AI๊ฐ ์ธ๊ฐ์ฒ๋ผ ๋ค์ํ ๊ณผ๋ชฉ(์ํ, ์ญ์ฌ, ๋ฒ, ์ํ ๋ฑ 57๊ฐ)์ ์ผ๋ง๋ ์ ์ดํดํ๋์ง ํ๊ฐํ๋ ์ข ํฉ ์ํ.
์ฌ์ด ์ค๋ช
MMLU๋ โMassive Multitask Language Understandingโ์ ์ฝ์๋ก, ํ๊ตญ์ด๋ก๋ โ๋๊ท๋ชจ ๋ค์ค๊ณผ๋ชฉ ์ธ์ด ์ดํดโ์ด๋ค.
์ฝ๊ฒ ๋น์ ํ๋ฉด โAI์ ์๋ฅโ์ด๋ค.
์ธ๊ฐ์ด ์๋ฅ์์ ๊ตญ์ด, ์ํ, ์์ด, ๊ณผํ, ์ฌํ๋ฅผ ๋ณด๋ฏ์ด, MMLU๋ AI๊ฐ 57๊ฐ ๊ณผ๋ชฉ์ ๋ชจ๋ ํ ์คํธํ๋ค.
์ด๋ค ๊ณผ๋ชฉ๋ค์ด ์๋์?
- STEM: ์ํ, ๋ฌผ๋ฆฌ, ํํ, ์๋ฌผ, ์ปดํจํฐ๊ณผํ
- ์ธ๋ฌธํ: ์ฒ ํ, ์ญ์ฌ, ๋ฒํ, ์ค๋ฆฌ
- ์ฌํ๊ณผํ: ๊ฒฝ์ ํ, ์ฌ๋ฆฌํ, ์ฌํํ, ์ ์นํ
- ์ ๋ฌธ๋ถ์ผ: ์ํ, ํ๊ณ, ๊ฒฝ์
- ๊ธฐํ ๋ฑ๋ฑโฆ
๋ฌธ์ ํ์:
4์ง์ ๋คํ ๊ฐ๊ด์
๋ฌธ์ : ์์์ญํ์์ ๋ถํ์ ์ฑ ์๋ฆฌ๋ฅผ ์ ์ํ ์ฌ๋์?
A) ์์ธ์ํ์ธ
B) ํ์ด์ ๋ฒ ๋ฅดํฌ โ ์ ๋ต
C) ์๋ขฐ๋ฉ๊ฑฐ
D) ๋ณด์ด
๋์ด๋:
- ์ด๋ฑํ๊ต ์์ค ๋ฌธ์ ๋ถํฐ
- ๋ํ ์ ๊ณต ์์ค ๋ฌธ์ ๊น์ง
- ์ ๋ฌธ๊ฐ ์์ค ๋ฌธ์ ๊น์ง
ํต์ฌ ํฌ์ธํธ
- 57๊ฐ ๊ณผ๋ชฉ: ์ธ๊ฐ ์ง์์ ๊ฑฐ์ ๋ชจ๋ ์์ญ ํฌ๊ด
- 15,908๊ฐ ๋ฌธ์ : ์ถฉ๋ถํ ๋ง์ ๋ฌธ์ ๋ก ์ ๋ขฐ์ฑ ํ๋ณด
- 5-shot ํ๊ฐ: AI์๊ฒ ์์ 5๊ฐ๋ฅผ ๋จผ์ ๋ณด์ฌ์ค ํ ๋ฌธ์ ํ๊ฒ ํจ
- ๊ฐ๊ด์: ์ฃผ๊ด์๋ณด๋ค ํ๊ฐ๊ฐ ๋ช ํํ๊ณ ๊ณต์ ํจ
๊ด๋ จ ๊ฐ๋
- Fine-tuning - MMLU ์ ์ ํฅ์์ ์ํด Fine-tuning ์ํ
- HumanEval - ์ฝ๋ ์์ฑ ๋ฅ๋ ฅ ํ๊ฐ (MMLU๋ ์ง์ ํ๊ฐ)
- KoBEST - ํ๊ตญ์ด ๋ฒ์ ์ ์ข ํฉ ํ๊ฐ
- GSM8K - ์ํ ์ถ๋ก ํ๊ฐ (MMLU์ ์ํ ๋ถ๋ถ๊ณผ ์ ์ฌ)
- Perplexity (PPL) - ํ์ต ์ค ์ฑ๋ฅ ๋ชจ๋ํฐ๋ง, MMLU๋ ์ต์ข ํ๊ฐ
R4 ์ฐ๊ตฌ์์์ ์ญํ
MMLU๋ R4 ์ฐ๊ตฌ์ ์ฃผ์ ์ฑ๋ฅ ์ธก์ ๋๊ตฌ ์ค ํ๋์ด๋ค.
์ MMLU๋ฅผ ์ฌ์ฉํ๋?
- ์ข ํฉ์ ํ๊ฐ: 57๊ฐ ๊ณผ๋ชฉ โ ๋ชจ๋ธ์ ์ ๋ฐ์ ์ง์ ์์ค ํ์
- ๊ตญ์ ํ์ค: ์ ์ธ๊ณ AI ์ฐ๊ตฌ์์ ์ฌ์ฉํ๋ ๋ฒค์น๋งํฌ
- ์ถ๋ก ๋ฅ๋ ฅ ํ๊ฐ: ๋จ์ ์๊ธฐ๊ฐ ์๋ ์ดํด์ ์ถ๋ก ํ์
R4 ์ฐ๊ตฌ์ MMLU ์ฌ์ฉ:
- ํ๊ฐ ์ฃผ๊ธฐ: ๋งค 500 ์คํ ๋ง๋ค ์ธก์
- ํ๊ฐ ๋ฐฉ๋ฒ: 5-shot (์์ 5๊ฐ ์ ๊ณต ํ ํ๊ฐ)
-
๊ธฐ๋ ๊ฒฐ๊ณผ:
- Random Fine-tuning ๋๋น +2~4% ํฅ์
- Fixed EโH ๋๋น +1~2% ํฅ์
- Fixed HโE ๋๋น +3~5% ํฅ์
์คํ ์กฐ๊ฑด๋ณ ์์ MMLU ์ ์:
Random: 65%
Fixed EโH: 67%
Fixed HโE: 63%
ZPD-Adaptive: 69% โ R4 ์ ์ ๋ฐฉ๋ฒ
MMLU๊ฐ ์ค์ํ ์ด์ :
- ์ถ๋ก ํ์คํฌ: R4 ์ฐ๊ตฌ๋ โ์ถ๋ก ์ค์ฌ ํ์คํฌ์์ ZPD-Adaptive๊ฐ ๋ ํจ๊ณผ์ โ์ด๋ผ๋ ๊ฐ์ค(H3b) ๊ฒ์ฆ
- MMLU๋ ๋ํ์ ์ธ ์ถ๋ก ํ์คํฌ์ด๋ฏ๋ก, ZPD-Adaptive์ ํจ๊ณผ๊ฐ ํฌ๊ฒ ๋ํ๋ ๊ฒ์ผ๋ก ์์
๋ ์์๋ณด๊ธฐ
- Hendrycks, D., et al. (2021). Measuring Massive Multitask Language Understanding. ICLR 2021.
- ๊ณต๊ฐ ๋ฐ์ดํฐ์ : https://github.com/hendrycks/test
- GPT-4 MMLU ์ ์: 86.4% (์ธ๊ฐ ์ ๋ฌธ๊ฐ ์์ค)
- GPT-3.5 MMLU ์ ์: 70.0%
- ๋๋ค ์ฐ๊ธฐ ๊ธฐ์ค์ : 25% (4์ง์ ๋ค)
- ์ธ๊ฐ ์ ๋ฌธ๊ฐ ํ๊ท : ~89%
- ๊ณผ๋ชฉ๋ณ ์ ์ ์ฐจ์ด๊ฐ ํผ: ์ฌ์ด ๊ณผ๋ชฉ 90%+, ์ด๋ ค์ด ๊ณผ๋ชฉ 50% ๋ฏธ๋ง