DeepSeek dnes na své API platformě zpřístupnil experimentální multimodální model V4-Flash-Vision-Exp. Jde o první výrazný posun společnosti směrem k vidění: model podle vývojářů kopíruje textové schopnosti modelu V4-Flash včetně agentních úloh, uvažování a znalostí světa, a v multimodálních agentních benchmarcích se přibližuje výkonům modelu Opus 4.8. Obrázky se tokenizují pro účely fakturace, až 384 tokenů za jeden snímek při cenách modelu V4-Flash. Model podporuje kombinovaný textový a obrazový vstup, přičemž obrázky lze posílat jako base64, přes URL nebo nově přes Files API, které DeepSeek rovněž spustil. Současně vyšla verze 0.1.1 nástroje DeepSeek Harness s podporou nového modelu. Zatím není jasné, zda půjde o otevřené váhy, komentáře na Hacker News se na to ptají.
DeepSeek spustil experimentální model s viděním V4-Flash-Vision-Exp