Unveiling Biomedical Question Answering Pathways in Large Language Models: An Interpretability Study with Circuit Discovery
This study applies mechanistic interpretability techniques to uncover and analyze computational circuits within LLMs during biomedical question answering, and employs Automatic Circuit Discovery in combination with Edge Attribution Patching to enable scalable circuit extraction beyond toy settings.
Xilin Wang
· 0 citations