ChemDIRT: a diversified benchmark for robust chemistry-LLM evaluation
Read the original at arxiv.org→arXiv:2608.21504v1 Announce Type: new Abstract: The rapid advancement of large language models (LLMs) has led to increasing interest in their application to scientific domains such as chemistry. However, existing...
Original headline: "ChemDIRT: A Diversified Instruction, Representation, and Task Benchmark for Robust Chemistry-LLM Evaluation"
Coverage timeline
- Aug 25, 04:00 UTC arXiv cs.LG lead source ChemDIRT: A Diversified Instruction, Representation, and Task Benchmark for Robust Chemistry-LLM Evaluation