CNM-BERT: a drop-in structural embedding for Chinese characters via Ideographic Description Sequences
Read the original at arxiv.org→arXiv:2608.05167v1 Announce Type: new Abstract: Token-based encoders like BERT treat Chinese characters as atomic identifiers, ignoring their recursive orthographic structure. Consequently, models rely on contextual...
Original headline: "CNM-BERT: A Drop-In Structural Embedding for Chinese Characters via Ideographic Description Sequences"
Coverage timeline
- Aug 7, 04:00 UTC arXiv cs.CL lead source CNM-BERT: A Drop-In Structural Embedding for Chinese Characters via Ideographic Description Sequences