"As a Language Model...": Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It
arXiv:2609.25021v1 Announce Type: cross Abstract: Large Language Models (LLMs) tend to add disclaimers like "I'm just an AI" when asked about something related to themselves. The self-reports from such responses are used in debates about AI safety or self-knowledge of the models, yet what drives…