LUNAR benchmarks personalized large language models on universal daily-life logs by evaluating responses from longitudinal app interaction histories across domains
Read the original at arxiv.org→arXiv:2608.05246v1 Announce Type: new Abstract: Existing personalized LLM benchmarks primarily rely on textual personas or isolated behavioral signals, providing limited evaluation of cross-domain behavioral...
Original headline: "LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs"
Coverage timeline
- Aug 7, 04:00 UTC arXiv cs.AI lead source LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs