KULTURE Bench: A Benchmark for Assessing Language Model in Korean Cultural Context

Large language models have exhibited significant enhancements in performance across various tasks. However, the complexity of their evaluation increases as these models generate more fluent and coherent content. Current multilingual benchmarks often use translated English versions, which may incorpo...

Ausführliche Beschreibung

Gespeichert in:

Bibliographische Detailangaben
Veröffentlicht in:	arXiv.org 2024-12
Hauptverfasser:	Wang, Xiaonan, Yeo, Jinyoung, Joon-Ho, Lim, Kim, Hansaem
Format:	Artikel
Sprache:	eng
Schlagworte:	Benchmarks Culture Large language models Performance evaluation Task complexity
Online-Zugang:	Volltext
Tags:	Tag hinzufügen Keine Tags, Fügen Sie den ersten Tag hinzu!

Schreiben Sie den ersten Kommentar!