商湯大模型的「5o」交互，普通人如何和 AI 過一天？

本文作者：張進

2024-07-15 18:42

導語：與真實世界的實時交互，是推動 AI 2.0 時代超級時刻和應(yīng)用爆發(fā)的一個核心。

「雷峰網(wǎng)(公眾號：雷峰網(wǎng))」在剛剛結(jié)束的堪稱「AI 界春晚」的世界人工智能大會（WAIC 2024）上，「中國版GPT-4o」亮相，它是來自商湯科技發(fā)布的“日日新5o”——國內(nèi)首個「流式交互」多模態(tài)大模型。

在商湯的演示下，日日新5o擁有像人一樣的實時視覺能力，可以跟人進行流暢的視頻交互——能聽、能說、能看、無延時，它可以通過攝像頭+語音實現(xiàn)和用戶的實時交互，并獲知用戶所在的真實場景下的各種狀態(tài)信息，打破了與AI交互的次元壁，實現(xiàn)了與AI的“視頻通話”，已經(jīng)具備真人聊天般的交互體驗。

兩個月前OpenAI推出了GPT-4o，以突破性的智能交互能力，徹底顛覆了我們對AI語音助手的認知，顛覆了過去的人機交互，給業(yè)界帶來又一次震撼。

震撼之外，中國大模型界對GPT-4o的認知似乎并不如GPT-4那么統(tǒng)一，有人認為「在實現(xiàn)AGI的路上，GPT-4o并不重要」、有人評價「在技術(shù)突破上，GPT-4o沒那么驚艷」；有人認為GPT-4o的發(fā)布是 AI 2.0 時代的標志性事件，會催生全新的應(yīng)用平臺和商業(yè)模式。

帶來的共識是，多模態(tài)可能引領(lǐng)新的交互模式和產(chǎn)品創(chuàng)新，多模態(tài)大模型開始成為國內(nèi)大模型競爭的下一個焦點。

然而，在國內(nèi)GPT-4o似乎并未成為引領(lǐng)多模態(tài)競爭的產(chǎn)品形態(tài)時，兩個月后商湯率先推出了「中國版GPT-4o」日日新5o大模型，商湯用行動力證明了對GPT-4o的判斷。

正如商湯 CEO 徐立在WAIC 2024上所講的：「行業(yè)要變化，交互模式一定是先行的」，解釋了商湯為什么要做「中國版GPT-4o」，首創(chuàng)流式交互大模型。

1 大模型可以是每個人的貼身AI全能助手

如果你擁有一個能看（現(xiàn)實世界）、能聽（讀懂指令）、能說（回答問題）的貼身 AI 助手，將會是一種什么體驗？

這位貼身助手，擁有豐富的多領(lǐng)域知識，包括生活、學習、工作各方面的知識，關(guān)鍵還能看懂現(xiàn)實世界——攝像頭就是它獲取現(xiàn)實世界影像的眼睛，而視覺觸及到的信息，它能立馬進行分析、總結(jié)，通過實時對話，像面對面聊天一樣，立即告訴你問題的答案，沒有延遲和拒絕。

早上起來，準備出門，你想知道現(xiàn)在外面的天氣應(yīng)該做哪些準備，日日新5o可以準確地描述出外面的天氣狀況，并給出外出準備的建議：

走到一處很美的地方，你想拍照，但是不知道用什么姿勢拍出來好看，日日新5o開始充當一個攝影助手，它會指導你如何根據(jù)當前景色擺姿勢動作、注意光線等等技巧：

晚飯是一頓燒烤，大家一起搭起炭火爐、燃起炭火準備燒烤，日日新5o能準確地知道視頻里的人們正在干嘛，而且還能告訴詳細的戶外燒烤注意事項：

你想知道每種食材分別要如何燒烤才好吃，此時日日新5o化身為一名擁有多年烹飪經(jīng)驗的燒烤大師，它能分辨出每種食材、要如何烤：

回到酒店，你看到一袋咖啡，詢問日日新5o后它能識別出這是咖啡粉而不是速溶咖啡，并告訴你咖啡粉對應(yīng)的沖泡步驟，宛如一個咖啡師：

日日新5o不僅擁有大量、多領(lǐng)域的生活方面的知識，在日常生活場景中分別充當了發(fā)型助手、攝影師、燒烤大師、咖啡師……在職場工作環(huán)境中，也是一把好手，比如能迅速地總結(jié)出這本書該頁講了什么知識。比人的反應(yīng)、分析、總結(jié)速度快多了：

面對一張手寫的字條或詩句，它也能立馬回答出它的意思和出處：

還能根據(jù)前三個字，準確預測出整個成語是什么：

從以上可以看到，日日新5o具備非常豐富的多領(lǐng)域知識，相比其他AI助手，它能看、能聽、能讀，首創(chuàng)的實時流式交互方式，使其具備真人般的交流對話；能精準地分析、辨別、總結(jié)出所「看到」的環(huán)境信息，在我們的生活、學習、工作中可以扮演多種助手角色，完全可以充當一款 AI 全能助手。

2 重塑交互的意義

日日新5o能作為一款表現(xiàn)出色的 AI 全能助手，除了展示出了它對標GPT-4o的各種能力：能看到那個現(xiàn)實世界，包括人、物、文字等符號；能聽懂用戶的話語，并根據(jù)其中的指令對現(xiàn)實世界進行識別，再反饋給用戶；能看書識字，概括總結(jié)所講的內(nèi)容……

最大的變革就是交互模式的變化：國內(nèi)首個流式交互多模態(tài)大模型。商湯將流式交互融入到大模型中，給用戶帶來真人般的交流體驗，讓日日新5o系統(tǒng)更像人。

我們知道，在人工智能發(fā)展中，ChatGPT之所一炮而紅，便是因為它開始展露出人類所具備的自主學習、分析、總結(jié)能力以及邏輯能力，而讓大模型像人一樣交流，正如引言所說，交互模式先行似乎并不是業(yè)界共識。

而商湯的日日新5o的發(fā)布，正是符合商湯對AI 2.0時代的判斷，正如CEO徐立所說：行業(yè)要變化，交互模式一定是先行的。

在徐立看來，變化是指能定義AI 2.0時代的「超級時刻」，正如iPhone時刻定義了移動互聯(lián)網(wǎng)的變化。而超級時刻需要一個超級應(yīng)用，即便是像ChatGPT、Sora都還沒有到超級時刻，是因為它們沒有真正走進到一個行業(yè)的垂直應(yīng)用中、引起廣泛變化。

走向應(yīng)用，商湯認為需要有幾個核心的重點突破：

第一個就是實時的交互性能帶來流暢的用戶體驗，這是推動超級時刻以及應(yīng)用爆發(fā)的一個核心。

第二是構(gòu)建高階思維邏輯的合成數(shù)據(jù)，來提升模型的智力。

最后，不管是文本、圖像、視頻，如果對它沒有可控性，那么它們作為一個工具，本身帶來的效能提升就非常有限。

大模型本質(zhì)上是做記憶的事情，記住世界的知識，就能回答的更準確，在徐立看來，它僅有的一點智力來自于對知識背后的高階的思維邏輯的記憶，所以，在垂直行業(yè)里面怎么構(gòu)造高階思維邏輯的合成數(shù)據(jù)，往往是制勝的關(guān)鍵，并且是差異化的關(guān)鍵，也是中國人工智能之路的關(guān)鍵。

商湯最新發(fā)布的日日新5.5基座模型，便用了大量的合成、高階思維鏈的數(shù)據(jù)，把模型能力平均提升了30%。

商湯大模型的「5o」交互，普通人如何和 AI 過一天？

商湯CEO徐立認為，如果要推動人工智能超級時刻的到來，需要大模型可以展現(xiàn)出卓越的深度思考的能力。那么合成的人工數(shù)據(jù)，特別是高階思維的數(shù)據(jù)往往是非常重要的。所以越是有應(yīng)用的場景，才能形成更好的高質(zhì)量的數(shù)據(jù)的一些核心。

過去垂直領(lǐng)域是依賴人去構(gòu)建更加高級的思維鏈數(shù)據(jù)，但是商湯認為，往前一步，不應(yīng)該依賴人，而是應(yīng)該通過跟真實世界的交互形成執(zhí)行數(shù)據(jù)，去做推理。

因此，基于基座模型日日新5.5，商湯研發(fā)了日日新5o流式交互多模態(tài)大模型，在攝像頭不停地移動過程中、跟真實世界互動獲取更多新的信息，去進行推理、再得出反饋。

日日新5o的各種功能離不開基座模型日日新5.5的支撐。今年4月發(fā)布的日日新5.0是國內(nèi)首個對標GPT-4 Turbo的大模型，經(jīng)過兩個多月技術(shù)迭代，日日新5.5實現(xiàn)了多項功能升級，在數(shù)學推理、英文能力、指令跟隨等能力上明顯增強，交互效果和多項核心指標可比肩GPT-4o。

徐立認為，如果能把這種流式交互多模態(tài)大模型置入眼鏡、手機、電腦等端側(cè)設(shè)備，可能會推動一些應(yīng)用的爆發(fā)。

雷峰網(wǎng)原創(chuàng)文章，未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。

0人收藏

相關(guān)文章

張進

主筆

發(fā)私信

當月熱門文章

商湯大模型的「5o」交互，普通人如何和 AI 過一天？

1 大模型可以是每個人的貼身AI全能助手

2 重塑交互的意義

商湯大模型的「5o」交互，普通人如何和 AI 過一天？