Reference
Sclar et al. 2024
Quantifying language models' sensitivity to spurious features in prompt design
Quantifying language models' sensitivity to spurious features in prompt design. Sclar, M., Choi, Y., Tsvetkov, Y., and Suhr, A. (2024). ICLR.
Relationship to this project — Prompt sensitivity
Establishes that prompt formatting matters broadly. X1/X2 here differ by prospective registration, a formally game-equivalent strategic task, and a held-out minimal-span confirmation of one atomic wording-and-position operation.