【AI前沿】HyOCR-1.5

2026-07-14

HyOCR-1.5 – 腾讯混元开源的轻量级端到端 OCR 专家大模型AI工具13小时前发布AI小集02HyOCR-1.5是什么HyOCR-1.5 是腾讯混元开源的轻量级端到端 OCR 专家大模型,仅 1B 参数能实现文档解析、文本识别、信息抽取、拍照翻译、图表解析、古文字识别、视频字幕提取与多页文档问答等全栈能力。模型基于 DFlash 投机解码,长结构化输出推理最高提速 6.37 倍;OmniDocBench v1.6 以 94.74 分位居端到端第一。HyOCR-1.5的主要功能文档解析:将密集文档、多栏版面、表格与公式一键转为结构化文本(Markdown/HTML/LaTeX)。文本检测识别:输出图片中全部文字内容及对应坐标,覆盖文档、街景、手写、广告、游戏、视频等场景。信息抽取:从票据、证件、收据中提取指定字段并按 JSON 格式返回。拍照翻译:提取图中文字并翻译为多种语言,保留文档版式与公式格式。图表解析:将流程图、统计图表解析为 Mermaid 或 Markdown 格式。古文字识别:支持汉字七体(甲骨、金文、篆、隶、楷、行、草)识别。视频字幕提取:从视频帧中精准提取字幕文本。多页文档问答:基于多页 PDF 进行跨页检索、比对与证据聚合问答。HyOCR-1.5的技术原理轻量端到端架构:沿用 HyOCR-1.0 验证过的紧凑设计,由原生分辨率视觉编码器 Hunyuan-ViT、自适应 MLP 连接器与轻量语言模型 Hunyuan-0.5B 组成,直接将多模态输入映射为 Markdown、HTML、LaTeX 等结构化输出,无需任何任务级后处理模块。4K 原生分辨率视觉编码:视觉编码器基于 Hunyuan-ViT 构建,最大输入分辨率从 2K 扩展至 4K,保持原始宽高比与空间布局,使模型能捕捉高密度文档、超大表格及复杂版面的细粒度结构细节。DFlash 投机解码:引入约 90.7M 参数的 block-diffusion 草稿模型,一次并行前向即可预测整块候选 token,再由目标模型单次验证并接受最长正确前缀;严格保持目标模型输出分布的同时,将长结构化 OCR 生成的解码延迟大幅降低。Agentic Data Flow:智能体驱动数据生产闭环,将模型短板转化为可执行数据需求,自主完成素材搜索、工具辅助清洗、难例挖掘与数据管线开发,并与算法工程师持续迭代。三阶段训练配方:预训练阶段重规划 Stage 3,注入新能力数据并扩展至 4K 分辨率与 128K 上下文;SFT 阶段彻底清洗数据、统一 prompt 接口;RL 阶段采用 IcePop(GRPO 风格)优化,通过事实性、一致性评判与退化抑制三类互补奖励提升输出质量。微信关注回复“开源”,加入AI开源项目交流群如何使用HyOCR-1.5环境准备:安装 Python 3.12+、CUDA 12.9、PyTorch 2.7.1 与 vLLM(≥0.12.0)。模型启动:执行vllm serve tencent/HunyuanOCR启动服务,或加载 Hugging Face 权重。图片输入:使用 PIL 读取图片并构建含 image 与 text 的 messages 对话结构。任务指令:按场景选择 Prompt,如文档解析、文字检测、信息抽取、翻译等。调用推理:通过 vLLM 或 Transformers 生成结果,设置 temperature=0 与 max_tokens=16384。结果清洗:使用内置去重函数清理可能的重复子串,获取最终结构化输出。本地部署:通过 llama.cpp 在 CPU 或消费级 GPU 上运行,无需服务器。HyOCR-1.5的核心优势极速推理:DFlash 投机解码让长文档生成在 Transformers 下提速 6.37 倍、vLLM 下提速 2.14 倍,端到端每页仅 1.4 秒。轻量可部署:1B 参数可通过 llama.cpp 在 CPU、消费级显卡及笔记本本地运行。SOTA 精度:OmniDocBench v1.6 端到端第一(94.74),表格 TEDS 93.67,复杂表格与阅读顺序表现突出。全栈开源:训练配方、推理框架、模型权重完整公开,可复现、可微调、可扩展。长尾能力:Agentic Data Flow 补齐 331 种低资源语种、古文字、多图问答等稀缺能力。高分辨率长上下文:支持 4K 图像分辨率与 128K 上下文,适配高密度长文档。幻觉抑制:CHAOS-Bench 页均召回率 14.15,优于现有模型,输出更忠于所见。HyOCR-1.5的项目地址GitHub仓库:https://github.com/Tencent-Hunyuan/HunyuanOCRHuggingFace模型库:https://huggingface.co/tencent/HunyuanOCRarXiv技术论文:https://arxiv.org/pdf/2607.04884HyOCR-1.5的同类竞品对比维度HyOCR-1.5DeepSeek-OCR-2参数规模1B(轻量)3B(大 3 倍)OmniDocBench94.7487.01端到端延迟1.408s / 页5.460s / 页(慢 3.9 倍)表格解析 TEDS93.67约 84.97推理加速DFlash 投机解码,Transformers 6.37× 提速无专用加速,纯自回归解码部署成本可跑在 CPU / 笔记本需服务器级 GPUHyOCR-1.5的应用场景密集文档数字化:一键将合同、论文、报告等高密度多栏版面转为 Markdown / HTML / LaTeX 结构化文本,保留阅读顺序与版式。复杂表格与公式解析:精准还原财务报表、学术论文中的超大表格与数学公式,支持 HTML 表格与 LaTeX 公式输出。多语种跨国文档处理:覆盖 331 种语言,自动识别并解析混合语种文档,适用于外贸、法务、出版等全球化业务场景。古文字研究与保护:识别甲骨、金文、篆书、隶书等汉字七体,辅助博物馆、考古机构对历史文献进行数字化存档与研究。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇Agnes-2.5-Flash - Agnes AI 推出的新一代高性能文本模型下一篇PixVerse Game - 爱诗科技推出的首个实时视频游戏引擎相关文章O1-CODER – 北交大推出的O1代码版开源项目,专注于编码任务AI小集2Spark-TTS – AI文本转语音工具,支持中英零样本语音克隆AI小集3Kimi K2 高速版 – 月之暗面Kimi推出的高性能版模型AI小集4DoraCycle – 新加坡国立大学推出多模态领域适应的统一生成模型AI小集2FaceApp – AI照片和视频编辑应用,AI驱动的支持多种滤镜效果AI小集3Mirage – strukto-ai 开源的 AI Agent 统一虚拟文件系统AI小集2暂无评论再想想发表评论暂无评论…热门工具豆包LibTV秒哒AiPPT秘塔AI搜索TRAE编程堆友Agent美图设计室绘蛙AISekoupdream办公小浣熊最新收录Jobright表答ChatSPSSKroWorkQMuse文智Doc最新文章ChatGPT Plus 和 Claude Pro 会员代充值 – 支持支付宝36分钟前PixVerse Game – 爱诗科技推出的首个实时视频游戏引擎39分钟前Agnes-2.5-Flash – Agnes AI 推出的新一代高性能文本模型17小时前SenseNova-Vision – 商汤开源的理解生成统一视觉大模型20小时前Step Edge – 阶跃星辰推出的端侧模型全家桶1天前DramaClaw – 工业级 AI 视频制作工具,提供一站式流水线2天前SeFi-Image – 开源的文本到图像模型,基于语义优先扩散2天前CodeMote – AI 原生跨端终端工具,支持远程操控编码环境2天前Agents-A1 – 上海 AI Lab开源的混合专家智能体模型3天前KAT-Coder-Pro V2.5 – 快手推出的 Agentic Coding 模型4天前LingBot-VA 2.0 – 蚂蚁灵波推出的具身原生世界动作模型4天前SensorFM – 谷歌推出面向可穿戴健康数据的通用基础模型4天前ChatGPT Work – OpenAI 推出的 ChatGPT 智能体工作台4天前LingBot-VLA 2.0 – 蚂蚁灵波开源的新一代具身智能基座模型4天前MkSaaS – 专为快速构建 AI SaaS 产品设计的全栈框架5天前