文本是对世界的压缩和抽象,而视觉是世界本身的投影。
多数人选择前者,比如OpenAI;而Google选择后者,从Gemini系列伊始就下注“原生多模态”技术路线,进“窄门”。
到了Gemini 3,Google将原生多模态与深度推理能力进行前所未有的结合,整个市场才看到路线选择的结果。
文本是对世界的压缩和抽象,而视觉是世界本身的投影。
多数人选择前者,比如OpenAI;而Google选择后者,从Gemini系列伊始就下注“原生多模态”技术路线,进“窄门”。
到了Gemini 3,Google将原生多模态与深度推理能力进行前所未有的结合,整个市场才看到路线选择的结果。