Comparing Bottom-Up and Top-Down Steering Approaches on In-Context Learning Tasks

A key objective of interpretability research on large language models (LLMs) is to develop methods for robustly steering models toward desired behaviors. To this end, two distinct approaches to interpretability -- ``bottom-up" and ``top-down" -- have been presented, but there has been litt...

Ausführliche Beschreibung

Gespeichert in:

Bibliographische Detailangaben
Veröffentlicht in:	arXiv.org 2024-11
Hauptverfasser:	Brumley, Madeline, Kwon, Joe, Krueger, David, Krasheninnikov, Dmitrii, Usman Anwar
Format:	Artikel
Sprache:	eng
Schlagworte:	Cognitive tasks Context Effectiveness Large language models Steering
Online-Zugang:	Volltext
Tags:	Tag hinzufügen Keine Tags, Fügen Sie den ersten Tag hinzu!

Schreiben Sie den ersten Kommentar!