Improving instruction hierarchy in frontier LLMs
IgnoreOpenAI Blog · 2026-03-10 11:00 UTC
Not analyzed yet
Eligible for automatic cleanup in 3 day(s) unless marked Must Read.
Content
IH-Challenge trains models to prioritize trusted instructions, improving instruction hierarchy, safety steerability, and resistance to prompt injection attacks.