KoBEST
KoBEST
ํ ์ค ์์ฝ
ํ๊ตญ์ด AI๊ฐ ํ๊ตญ์ด๋ฅผ ์ผ๋ง๋ ์ ์ดํดํ๋์ง ํ๊ฐํ๋ 5๊ฐ์ง ํ์คํฌ๋ก ๊ตฌ์ฑ๋ ์ข ํฉ ํ๊ตญ์ด ๋ฒค์น๋งํฌ.
์ฌ์ด ์ค๋ช
KoBEST๋ โKorean Benchmark Suite of Tasksโ์ ์ฝ์์ด๋ค. ์ฝ๊ฒ ๋งํด ํ๊ตญ์ดํ ์ข ํฉ ํ๊ฐ ์ํ์ด์์.
MMLU๊ฐ ์์ด๋ก ๋ 57๊ฐ ๊ณผ๋ชฉ ์ํ์ด๋ผ๋ฉด, KoBEST๋ ํ๊ตญ์ด๋ก ๋ 5๊ฐ ์์ญ ์ํ์ด๋ค.
์ KoBEST๊ฐ ํ์ํ๊ฐ์?
์์ด ๋ฒค์น๋งํฌ(MMLU, HumanEval)๋ง์ผ๋ก๋ ํ๊ตญ์ด ๋ฅ๋ ฅ์ ์ ๋๋ก ํ๊ฐํ ์ ์์ด์. ์๋ํ๋ฉด:
- ํ๊ตญ์ด ํน์ ์ ๋ฌธ๋ฒ (์กฐ์ฌ, ์ด๋ฏธ ๋ฑ)
- ํ๊ตญ ๋ฌธํ ๋งฅ๋ฝ (์ญ์ฌ, ๊ด์ฉ์ด ๋ฑ)
- ํ๊ตญ์ด ๋ฐ์ดํฐ๋ก ํ์ตํ ๋ชจ๋ธ์ ์ฑ๋ฅ ์ธก์ ํ์
KoBEST์ 5๊ฐ์ง ํ์คํฌ:
-
Boolean Question (BoolQ-KO): ์ฐธ/๊ฑฐ์ง ํ๋จ
์ง๋ฌธ: ์์ธ์ ๋ํ๋ฏผ๊ตญ์ ์๋์ด๋ค. ์ง๋ฌธ: ์์ธ์ด ์๋์ธ๊ฐ? ๋ต: True -
Choice of Plausible Alternatives (COPA-KO): ์์ธ/๊ฒฐ๊ณผ ์ถ๋ก
์ํฉ: ์์ด๊ฐ ์ธ์๋ค. ์ง๋ฌธ: ์์ธ์? A) ์ฅ๋๊ฐ์ด ๋ถ์์ก๋ค โ ์ ๋ต B) ๋ ์จ๊ฐ ์ข์๋ค -
Words-in-Context (WiC-KO): ๋จ์ด ์๋ฏธ ํ์
๋ฌธ์ฅ1: ์ฌ๊ณผ๋ฅผ ๋จน์๋ค. ๋ฌธ์ฅ2: ์๋ชป์ ์ฌ๊ณผํ๋ค. ์ง๋ฌธ: ๋ "์ฌ๊ณผ"์ ์๋ฏธ๊ฐ ๊ฐ์๊ฐ? โ False -
HellaSwag-KO: ์ด์ผ๊ธฐ ๋ค์ ๋ฌธ์ฅ ์์ธก
์ํฉ: ๋จ์๊ฐ ์ด๋์ฅ์์ ๋ฐ๊ณ ์๋ค. ๊ฐ์๊ธฐ ๋ฐ์ ํ๋๋ ๋ค. ๋ค์ ๋ฌธ์ฅ์? A) ๊ทธ๋ ๋์ด์ก๋ค โ ์ ๋ต B) ๊ทธ๋ ํ๋์ ๋ ์๋ค -
Sentiment Negation Recognition (SentiNeg-KO): ๋ถ์ ํํ ์ดํด
๋ฌธ์ฅ: "์ด ์ํ๋ ๋ณ๋ก ์ ์ข์ง ์์์ด" ๊ฐ์ : ๊ธ์ โ ์ด์ค๋ถ์ ์ดํด ํ์
ํต์ฌ ํฌ์ธํธ
- 5๊ฐ ํ์คํฌ: ํ๊ตญ์ด ์ดํด์ ๋ค์ํ ์ธก๋ฉด ํ๊ฐ
- ํ๊ตญ์ด ํนํ: ํ๊ตญ์ด ๋ฌธ๋ฒ, ๋งฅ๋ฝ, ๋ฌธํ ๋ฐ์
- 5-shot ํ๊ฐ: ์์ 5๊ฐ ์ ๊ณต ํ ํ๊ฐ
- ๊ณต๊ฐ ๋ฐ์ดํฐ: ํ๊ตญ AI Hub์์ ์ ๊ณต
๊ด๋ จ ๊ฐ๋
- MMLU - ์์ด ๋ค๊ณผ๋ชฉ ํ๊ฐ (KoBEST๋ ํ๊ตญ์ด ๋ฒ์ )
- Fine-tuning - ํ๊ตญ์ด ๋ฐ์ดํฐ๋ก Fine-tuning ํ KoBEST๋ก ํ๊ฐ
- SOLAR 10.7B - ํ๊ตญ์ด ํนํ ๋ชจ๋ธ, KoBEST ์ฑ๋ฅ ์ฐ์
- Perplexity (PPL) - ํ๊ตญ์ด ๋์ด๋ ์ธก์
R4 ์ฐ๊ตฌ์์์ ์ญํ
KoBEST๋ R4 ์ฐ๊ตฌ์์ ํ๊ตญ์ด ๋ฅ๋ ฅ ํ๊ฐ ์งํ๋ก ์ฌ์ฉ๋๋ค.
์ KoBEST๋ฅผ ์ฌ์ฉํ๋?
- SOLAR 10.7B ํ๊ฐ: ํ๊ตญ์ด ํนํ ๋ชจ๋ธ์ด๋ฏ๋ก ํ๊ตญ์ด ๋ฒค์น๋งํฌ ํ์
- ๋ค์ฐจ์ ํ๊ฐ: 5๊ฐ ํ์คํฌ๋ก ๋ค์ํ ์ธ์ด ์ดํด ๋ฅ๋ ฅ ์ธก์
- ์ถ๋ก ๋ฅ๋ ฅ ํ๊ฐ: ๋จ์ ๋ฒ์ญ์ด ์๋ ์ถ๋ก , ๋งฅ๋ฝ ์ดํด ํ์
R4 ์ฐ๊ตฌ์ KoBEST ์ฌ์ฉ:
- ํ๊ฐ ์ฃผ๊ธฐ: ๋งค 500 ์คํ ๋ง๋ค ์ธก์
- ํ๊ฐ ๋ฐฉ๋ฒ: 5-shot
- ๊ธฐ๋ ๊ฒฐ๊ณผ: ๋ค๋ฅธ ๋ฒค์น๋งํฌ์ ์ ์ฌํ๊ฒ ZPD-Adaptive๊ฐ ์ฐ์
๋ชจ๋ธ๋ณ ํน์ฑ:
| ๋ชจ๋ธ | ์ธ์ด ํน์ฑ | ์์ด ๋ฒค์น๋งํฌ | ํ๊ตญ์ด ๋ฒค์น๋งํฌ | |โโ|โโโ-|โโโโโ|โโโโโ-| | SOLAR 10.7B | ํ๊ตญ์ด ํนํ | MMLU, HumanEval | KoBEST โ ๊ฐ์ | | Qwen2.5 7B | ๋ค๊ตญ์ด | MMLU, HumanEval | KoBEST |
์ฐ๊ตฌ ๊ฐ์ค ๊ฒ์ฆ (R1):
KoBEST๋ ๊ถ์ฅ ์์ ์ฌํญ R1 โํ๊ตญ์ด ๋ชจ๋ธ ํน์์ฑ ํ์โ์ ํ์ฉ:
- SOLAR 10.7B์ KoBEST ์ฑ๋ฅ vs MMLU ์ฑ๋ฅ ๋น๊ต
- ํ๊ตญ์ด ํ์คํฌ์์ ZPD-Adaptive ํจ๊ณผ๊ฐ ๋ ํฐ์ง ๋ถ์
๋ ์์๋ณด๊ธฐ
- ํ๊ตญ AI Hub์์ ๊ณต๊ฐ: https://aihub.or.kr
- KLUE (Korean Language Understanding Evaluation)์ ํจ๊ป ๋ํ์ ์ธ ํ๊ตญ์ด ๋ฒค์น๋งํฌ
- GPT-4์ KoBEST ์ ์: ์ฝ 75-80% (์์ด MMLU๋ณด๋ค ๋ฎ์)
- ํ๊ตญ์ด ํนํ ๋ชจ๋ธ๋ค์ด ์์ด ๋ชจ๋ธ๋ณด๋ค KoBEST์์ ์ฐ์ํ ๊ฒฝํฅ
- 5๊ฐ ํ์คํฌ ์ธ์๋ ํ์ฅ ๋ฒ์ ์๋ NER(๊ฐ์ฒด๋ช ์ธ์), QA(์ง์์๋ต) ๋ฑ ์ถ๊ฐ