智元大模型登上DailyOmni全模態(tài)理解榜單首位 每日關(guān)注
【資料圖】
7月28日,記者獲悉,近日,具身全模態(tài)理解權(quán)威榜單DailyOmni最新評(píng)測(cè)結(jié)果揭曉,智元自研的具身原生全模態(tài)大模型WITA-Omni Preview,憑借音視頻聯(lián)合理解與時(shí)序推理能力,以85.21分綜合成績(jī)登陸榜單首位,在八項(xiàng)細(xì)分指標(biāo)中的六項(xiàng)取得第一。
對(duì)于人形機(jī)器人交互能力來說,以往的全模態(tài)模型大多優(yōu)先適配線上數(shù)字內(nèi)容交互,而機(jī)器人身處持續(xù)變化的物理空間,不僅需要同步“看見畫面、聽見聲音”,更要實(shí)時(shí)判斷聲音歸屬主體、事件發(fā)生順序,識(shí)別交互對(duì)象、找準(zhǔn)響應(yīng)時(shí)機(jī),傳統(tǒng)模塊化機(jī)器人方案很難完成這類時(shí)序耦合的復(fù)雜推理任務(wù),也是長久以來人機(jī)交互生硬割裂的關(guān)鍵瓶頸。
對(duì)具身智能機(jī)器人而言,“理解”和“回應(yīng)”并不是兩個(gè)割裂的步驟,而是一個(gè)持續(xù)發(fā)生的物理過程。機(jī)器人需要一邊觀察環(huán)境、一邊接收聲音;一邊組織語言、一邊配合動(dòng)作和表情。在多人、開放且持續(xù)變化的真實(shí)環(huán)境中,它還必須進(jìn)一步判斷:是否應(yīng)該回應(yīng)、什么時(shí)候回應(yīng),以及正在與誰交互。
據(jù)智元方面介紹,WITA-Omni并不是簡(jiǎn)單地把聊天模型“裝進(jìn)”機(jī)器人,而是將物理動(dòng)作和表情提升為與語音并列的一級(jí)輸出,用一個(gè)原生端到端模型統(tǒng)一驅(qū)動(dòng)感知、決策與表達(dá)。
同時(shí),WITA-Omni一套圍繞具身全模態(tài)交互構(gòu)建的分層數(shù)據(jù)體系與針對(duì)性訓(xùn)練方法。在中訓(xùn)練階段,WITA-Omni 使用千萬小時(shí)級(jí)多模態(tài)數(shù)據(jù),將強(qiáng)文本、視覺底座進(jìn)一步升級(jí)為能夠“聽得見、看得懂,并進(jìn)行音畫聯(lián)合推理”的全模態(tài)模型。模型不僅學(xué)會(huì)“回答正確”,還進(jìn)一步學(xué)會(huì)在真實(shí)場(chǎng)景中判斷:該不該回應(yīng)、何時(shí)回應(yīng),以及回應(yīng)誰。
標(biāo)簽: 財(cái)經(jīng)頻道 財(cái)經(jīng)資訊

南向資金今日凈賣出美團(tuán)9.24億港元