Hugging Face zveřejnil NeoMME, multimodální a vícejazyčný enkodér od týmu H Company. Model zpracovává textové tokeny i obrazové části v jediném obousměrném Transformeru, místo aby kombinoval samostatný obrazový a textový modul. Autoři uvádějí, že NeoMME nevychází z předtrénované obrazové věže ani z hotového textového enkodéru či dekodéru. K dispozici jsou velikosti 260 a 800 milionů parametrů a modely pro vyhledávání ve vizuálních dokumentech. Menší retriever podle zveřejněných výsledků dosahuje skóre 0,523 na benchmarku ViDoRe v3 a kóduje přibližně 51 stran za sekundu na GPU NVIDIA L40S. Checkpointy jsou dostupné v Transformers pod licencí Apache 2.0.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.