Digital Garden

MMLU

๐Ÿ‘€ 1

MMLU

ํ•œ ์ค„ ์š”์•ฝ

AI๊ฐ€ ์ธ๊ฐ„์ฒ˜๋Ÿผ ๋‹ค์–‘ํ•œ ๊ณผ๋ชฉ(์ˆ˜ํ•™, ์—ญ์‚ฌ, ๋ฒ•, ์˜ํ•™ ๋“ฑ 57๊ฐœ)์„ ์–ผ๋งˆ๋‚˜ ์ž˜ ์ดํ•ดํ•˜๋Š”์ง€ ํ‰๊ฐ€ํ•˜๋Š” ์ข…ํ•ฉ ์‹œํ—˜.

์‰ฌ์šด ์„ค๋ช…

MMLU๋Š” โ€œMassive Multitask Language Understandingโ€์˜ ์•ฝ์ž๋กœ, ํ•œ๊ตญ์–ด๋กœ๋Š” โ€œ๋Œ€๊ทœ๋ชจ ๋‹ค์ค‘๊ณผ๋ชฉ ์–ธ์–ด ์ดํ•ดโ€์ด๋‹ค.

์‰ฝ๊ฒŒ ๋น„์œ ํ•˜๋ฉด โ€œAI์˜ ์ˆ˜๋Šฅโ€์ด๋‹ค.

์ธ๊ฐ„์ด ์ˆ˜๋Šฅ์—์„œ ๊ตญ์–ด, ์ˆ˜ํ•™, ์˜์–ด, ๊ณผํ•™, ์‚ฌํšŒ๋ฅผ ๋ณด๋“ฏ์ด, MMLU๋Š” AI๊ฐ€ 57๊ฐœ ๊ณผ๋ชฉ์„ ๋ชจ๋‘ ํ…Œ์ŠคํŠธํ•œ๋‹ค.

์–ด๋–ค ๊ณผ๋ชฉ๋“ค์ด ์žˆ๋‚˜์š”?

  • STEM: ์ˆ˜ํ•™, ๋ฌผ๋ฆฌ, ํ™”ํ•™, ์ƒ๋ฌผ, ์ปดํ“จํ„ฐ๊ณผํ•™
  • ์ธ๋ฌธํ•™: ์ฒ ํ•™, ์—ญ์‚ฌ, ๋ฒ•ํ•™, ์œค๋ฆฌ
  • ์‚ฌํšŒ๊ณผํ•™: ๊ฒฝ์ œํ•™, ์‹ฌ๋ฆฌํ•™, ์‚ฌํšŒํ•™, ์ •์น˜ํ•™
  • ์ „๋ฌธ๋ถ„์•ผ: ์˜ํ•™, ํšŒ๊ณ„, ๊ฒฝ์˜
  • ๊ธฐํƒ€ ๋“ฑ๋“ฑโ€ฆ

๋ฌธ์ œ ํ˜•์‹:

4์ง€์„ ๋‹คํ˜• ๊ฐ๊ด€์‹

๋ฌธ์ œ: ์–‘์ž์—ญํ•™์—์„œ ๋ถˆํ™•์ •์„ฑ ์›๋ฆฌ๋ฅผ ์ œ์•ˆํ•œ ์‚ฌ๋žŒ์€?
A) ์•„์ธ์Šˆํƒ€์ธ
B) ํ•˜์ด์  ๋ฒ ๋ฅดํฌ  โ† ์ •๋‹ต
C) ์Šˆ๋ขฐ๋”ฉ๊ฑฐ
D) ๋ณด์–ด

๋‚œ์ด๋„:

  • ์ดˆ๋“ฑํ•™๊ต ์ˆ˜์ค€ ๋ฌธ์ œ๋ถ€ํ„ฐ
  • ๋Œ€ํ•™ ์ „๊ณต ์ˆ˜์ค€ ๋ฌธ์ œ๊นŒ์ง€
  • ์ „๋ฌธ๊ฐ€ ์ˆ˜์ค€ ๋ฌธ์ œ๊นŒ์ง€

ํ•ต์‹ฌ ํฌ์ธํŠธ

  • 57๊ฐœ ๊ณผ๋ชฉ: ์ธ๊ฐ„ ์ง€์‹์˜ ๊ฑฐ์˜ ๋ชจ๋“  ์˜์—ญ ํฌ๊ด„
  • 15,908๊ฐœ ๋ฌธ์ œ: ์ถฉ๋ถ„ํžˆ ๋งŽ์€ ๋ฌธ์ œ๋กœ ์‹ ๋ขฐ์„ฑ ํ™•๋ณด
  • 5-shot ํ‰๊ฐ€: AI์—๊ฒŒ ์˜ˆ์‹œ 5๊ฐœ๋ฅผ ๋จผ์ € ๋ณด์—ฌ์ค€ ํ›„ ๋ฌธ์ œ ํ’€๊ฒŒ ํ•จ
  • ๊ฐ๊ด€์‹: ์ฃผ๊ด€์‹๋ณด๋‹ค ํ‰๊ฐ€๊ฐ€ ๋ช…ํ™•ํ•˜๊ณ  ๊ณต์ •ํ•จ

๊ด€๋ จ ๊ฐœ๋…

  • Fine-tuning - MMLU ์ ์ˆ˜ ํ–ฅ์ƒ์„ ์œ„ํ•ด Fine-tuning ์ˆ˜ํ–‰
  • HumanEval - ์ฝ”๋“œ ์ƒ์„ฑ ๋Šฅ๋ ฅ ํ‰๊ฐ€ (MMLU๋Š” ์ง€์‹ ํ‰๊ฐ€)
  • KoBEST - ํ•œ๊ตญ์–ด ๋ฒ„์ „์˜ ์ข…ํ•ฉ ํ‰๊ฐ€
  • GSM8K - ์ˆ˜ํ•™ ์ถ”๋ก  ํ‰๊ฐ€ (MMLU์˜ ์ˆ˜ํ•™ ๋ถ€๋ถ„๊ณผ ์œ ์‚ฌ)
  • Perplexity (PPL) - ํ•™์Šต ์ค‘ ์„ฑ๋Šฅ ๋ชจ๋‹ˆํ„ฐ๋ง, MMLU๋Š” ์ตœ์ข… ํ‰๊ฐ€

R4 ์—ฐ๊ตฌ์—์„œ์˜ ์—ญํ• 

MMLU๋Š” R4 ์—ฐ๊ตฌ์˜ ์ฃผ์š” ์„ฑ๋Šฅ ์ธก์ • ๋„๊ตฌ ์ค‘ ํ•˜๋‚˜์ด๋‹ค.

์™œ MMLU๋ฅผ ์‚ฌ์šฉํ•˜๋‚˜?

  1. ์ข…ํ•ฉ์  ํ‰๊ฐ€: 57๊ฐœ ๊ณผ๋ชฉ โ†’ ๋ชจ๋ธ์˜ ์ „๋ฐ˜์  ์ง€์‹ ์ˆ˜์ค€ ํŒŒ์•…
  2. ๊ตญ์ œ ํ‘œ์ค€: ์ „ ์„ธ๊ณ„ AI ์—ฐ๊ตฌ์—์„œ ์‚ฌ์šฉํ•˜๋Š” ๋ฒค์น˜๋งˆํฌ
  3. ์ถ”๋ก  ๋Šฅ๋ ฅ ํ‰๊ฐ€: ๋‹จ์ˆœ ์•”๊ธฐ๊ฐ€ ์•„๋‹Œ ์ดํ•ด์™€ ์ถ”๋ก  ํ•„์š”

R4 ์—ฐ๊ตฌ์˜ MMLU ์‚ฌ์šฉ:

  • ํ‰๊ฐ€ ์ฃผ๊ธฐ: ๋งค 500 ์Šคํ…๋งˆ๋‹ค ์ธก์ •
  • ํ‰๊ฐ€ ๋ฐฉ๋ฒ•: 5-shot (์˜ˆ์‹œ 5๊ฐœ ์ œ๊ณต ํ›„ ํ‰๊ฐ€)
  • ๊ธฐ๋Œ€ ๊ฒฐ๊ณผ:
    • Random Fine-tuning ๋Œ€๋น„ +2~4% ํ–ฅ์ƒ
    • Fixed Eโ†’H ๋Œ€๋น„ +1~2% ํ–ฅ์ƒ
    • Fixed Hโ†’E ๋Œ€๋น„ +3~5% ํ–ฅ์ƒ

์‹คํ—˜ ์กฐ๊ฑด๋ณ„ ์˜ˆ์ƒ MMLU ์ ์ˆ˜:

Random:           65%
Fixed Eโ†’H:        67%
Fixed Hโ†’E:        63%
ZPD-Adaptive:     69%  โ† R4 ์ œ์•ˆ ๋ฐฉ๋ฒ•

MMLU๊ฐ€ ์ค‘์š”ํ•œ ์ด์œ :

  • ์ถ”๋ก  ํƒœ์Šคํฌ: R4 ์—ฐ๊ตฌ๋Š” โ€œ์ถ”๋ก  ์ค‘์‹ฌ ํƒœ์Šคํฌ์—์„œ ZPD-Adaptive๊ฐ€ ๋” ํšจ๊ณผ์ โ€์ด๋ผ๋Š” ๊ฐ€์„ค(H3b) ๊ฒ€์ฆ
  • MMLU๋Š” ๋Œ€ํ‘œ์ ์ธ ์ถ”๋ก  ํƒœ์Šคํฌ์ด๋ฏ€๋กœ, ZPD-Adaptive์˜ ํšจ๊ณผ๊ฐ€ ํฌ๊ฒŒ ๋‚˜ํƒ€๋‚  ๊ฒƒ์œผ๋กœ ์˜ˆ์ƒ

๋” ์•Œ์•„๋ณด๊ธฐ

  • Hendrycks, D., et al. (2021). Measuring Massive Multitask Language Understanding. ICLR 2021.
  • ๊ณต๊ฐœ ๋ฐ์ดํ„ฐ์…‹: https://github.com/hendrycks/test
  • GPT-4 MMLU ์ ์ˆ˜: 86.4% (์ธ๊ฐ„ ์ „๋ฌธ๊ฐ€ ์ˆ˜์ค€)
  • GPT-3.5 MMLU ์ ์ˆ˜: 70.0%
  • ๋žœ๋ค ์ฐ๊ธฐ ๊ธฐ์ค€์„ : 25% (4์ง€์„ ๋‹ค)
  • ์ธ๊ฐ„ ์ „๋ฌธ๊ฐ€ ํ‰๊ท : ~89%
  • ๊ณผ๋ชฉ๋ณ„ ์ ์ˆ˜ ์ฐจ์ด๊ฐ€ ํผ: ์‰ฌ์šด ๊ณผ๋ชฉ 90%+, ์–ด๋ ค์šด ๊ณผ๋ชฉ 50% ๋ฏธ๋งŒ