DeepSeek多模态模型来了创新推理框架引领变革

2026-04-30 23:50:22 每日经济新闻56之窗百科网16

核心提示：4月30日，DeepSeek在Github上正式发布了多模态模型，并公布了背后的技术报告。技术报告中提到，尽管多模态大语言模型取得了显著进展，但主流的思维链范式仍主要局限于语言学领域

4月30日，DeepSeek在Github上正式发布了多模态模型，并公布了背后的技术报告。技术报告中提到，尽管多模态大语言模型取得了显著进展，但主流的思维链范式仍主要局限于语言学领域。近期研究虽然通过高分辨率裁剪技术来弥合感知鸿沟，却忽视了一个更根本的问题：参照鸿沟。自然语言的模糊性往往无法为复杂的空间布局提供精确、明确的指引，导致需要严谨参照的任务出现逻辑崩溃。

DeepSeek的多模态技术报告提出基于视觉原语的思考——这一创新推理框架将点、边界框等空间标记提升为“思维的基本单元”。通过将这些视觉原语直接融入思考过程，模型在“推理”时能够“指代”，从而将其认知轨迹有效锚定在图像的物理坐标中。

技术报告还指出，该框架基于高度优化的架构，具备极高的视觉标记效率。尽管模型规模紧凑且图像标记预算较低，DeepSeek的多模态模型在具有挑战性的计数和空间推理基准测试上，能够与GPT-5.4、Claude-Sonnet-4.6和Gemini-3-Flash等前沿模型匹配。这为开发更高效、更具可扩展性的System-2类多模态智能提供了新的方向。

收藏 0打赏 0

更多>同类资讯

狼人科技
加关注0
~~没有留下签名~~~~

推荐图文

女子多肉盆下发现碗口	钱学森“灵境”预言照
张柏芝一身黑衣现身机	容祖儿锐评自己早年绿

推荐资讯

点击排行

• 女子多肉盆下发现碗口粗蟒蛇这是什么场面？	• 阿里76亿元投资长鑫搏出近1700亿 A股历史被改写
• QQ等级换算成Token的具体比例是多少	• 敬一丹公众号疑辟谣脑溢血传闻精选留言不信谣
• 伊朗谴责保加利亚配合美军对伊行动构成侵略行	• 越来越多中国人不去日本旅游日元贬值背后的旅
• 九寨沟发布门票售罄通告已达最大承载量	• 苹果总市值超越英伟达重返全球第一股价上涨带
• 国内首部AI长片首播观众反响良好	• 法国巴黎发生持刀伤人事件 3人受伤袭击者已被

DeepSeek多模态模型来了 创新推理框架引领变革

DeepSeek多模态模型来了创新推理框架引领变革