Multilingual safety gaps in frontier language models: in-context scheming scales with pretraining language coverage, according to Petri auditing findings
Read the original at arxiv.org→arXiv:2607.24769v1 Announce Type: new Abstract: With the growing capabilities of frontier models, AI alignment becomes increasingly critical in high-risk deployment settings. While recent work has empirically...
Original headline: "LLM Scheming Inversely Scales with Pretraining Language Coverage"
Coverage timeline
- Jul 29, 04:00 UTC arXiv cs.AI lead source LLM Scheming Inversely Scales with Pretraining Language Coverage