Tencent/Youtu-Parsing-Omni: a compact 5B omni-modal parsing model outputs a structured JSON envelope for diverse inputs including documents, images, charts, geometry figures, audio, and video
Read the original at www.reddit.com→Youtu-Parsing-Omni is a compact (5B) omni-modal parsing model. Given a single input — a document page, a natural image, a chart / flowchart, a geometry figure, an audio clip or an audio-visual video — it produces one...
Original headline: "tencent/Youtu-Parsing-Omni · Hugging Face"
Coverage timeline
- Oct 9, 12:03 UTC r/LocalLLaMA lead source tencent/Youtu-Parsing-Omni · Hugging Face