❯ DeepSeek 识图模式正式上线 App 和网页端
多模态落地据 IT之家报道,DeepSeek 的”识图模式”正式在 App 和网页端上线,与原有的”快速模式""专家模式”并列。开启后,用户可直接上传图片让模型”看图说话”,能力远超简单的文字提取(OCR)。该功能此前自今年 4 月底起经历灰度测试,如今面向更大范围开放。
不止于 OCR官方与多家测评强调,识图模式支持的是深度图像理解,而非单纯认字:在文物鉴定、截图转码、空间推理、表情包解读、地理位置推断等场景上都有表现。这一步把 DeepSeek 从纯文本模型推入图文交互时代,也让它补齐了相对国内外多模态对手的一块明显短板——此前国内头部模型已大多具备视觉能力,DeepSeek 的”睁眼”是把这条能力线补齐的关键一环。
补齐这一环对依赖 DeepSeek API 搭建应用的开发者,眼下可以重新规划的是产品形态:原本只能处理文本的工作流,现在能接入图像输入,文档解析、视觉问答这类需求不必再外挂第三方视觉模型。对其他国产大模型,DeepSeek 补上视觉短板后,仅靠”多模态”已难再构成对它的差异化优势。
signal: 当以文本推理见长的 DeepSeek 也补齐视觉,多模态正从国产大模型的卖点退化为标配。