編輯丨李希
今年關於具身智慧的討論裡,有一個問題始終繞不開:機器人進了家門,到底靠什麼讓人願意留著它?
工廠的邏輯很簡單:幹得準、跑得穩,得能執行,還能創收。但家庭場景不一樣:一個動作失誤、一次對意圖的理解偏差,使用者的心理容錯率幾乎為零——錯一次,機器人就可能就被退貨,或者放在角落吃灰。
這個現實,讓行業分出了兩條路。一條路上的公司,繼續死磕物理智慧,讓機器人能夠無限接近理解物理世界;另一條開始往回退一步,先想清楚一件事——機器人要怎麼理解人,才能在人身邊待得住。
星熾動力顯然是後者。爲了瞭解他們的想法,AI 科技評論和公司的 CTO 李達聊了聊。
李達的履歷並不神祕。中科院自動化所博士,師從譚鐵牛院士,長期做視覺導航和連續學習,成果多次在領域頂級期刊發表,上過 IEEE TIP。進入星熾動力之前,李博士曾在自動化所工作學習十餘年,學術底子算得上紮實,但他現在做的,是把這些積累倒進一個家庭場景裡,重新審視一個被忽視很久的問題:機器人如果不懂人,憑什麼跟人一起生活?
「今天的具身大腦講的更多的是‘環境動力學’——但我們不光要考慮物理環境的變化,也要把使用者的狀態推演出來。」討論中,李達常常強調這一點。
為此,星熾動力推出的 PULSE 架構,是把具身大腦拆成了「雙軌」:一條軌跑物理環境的感知和推演,另一條軌跑使用者狀態的感知和推演。兩條軌不是孤立執行,而是在特徵層面做交叉驗證。
物理資訊告訴機器人「環境怎麼了」,使用者狀態資訊告訴機器人「人怎麼了」,兩者合併,才能輸出一個更靠譜的決策。
家庭場景裡,人不是環境裡的一件物體,而是互動的中心。如果機器人的認知模型裡只有桌子、杯子、沙發,卻沒有坐沙發的人的狀態,那它永遠只能做一個被動的命令列工具——人發指令,機器執行,像在用 CLI(命令列)操作一臺機器。
但在家裏,如果老人、小孩沒法很明確地提出指令,那麼機器人是否就沒法在家庭場景好好工作?
怎麼讓機器人理解人?PULSE 的答案落在三個關鍵詞上:意圖、信念、偏好。
意圖是使用者說了什麼、做了什麼,機器人能不能讀懂。
信念更有意思——李達舉了一個例子:男主人認為牛奶還在微波爐裡,但女主人已經拿出來了。男主人持有的是一個「錯誤信念」。如果機器人只盯著物理世界,它看到的是微波爐裡沒有牛奶,它不會理解男主人接下來要去做的動作是基於一個錯誤的前提。但如果機器人有能力表徵人的信念狀態,它就能主動提醒:「牛奶已經被拿出來了。」這種糾偏能力,纔是家庭場景裡真正有用的智慧。
偏好則更長期,涉及使用者的習慣、邊界、隱私,需要靠持續的互動來積累。
這三者構成的理解模型,不是掛在系統外的一個附加模組,而是被李達團隊直接嵌入世界模型的條件化輸入裡。使用者狀態被表徵為隱空間的特徵向量,以類似 token 的形式參與跨注意力計算,和環境特徵做對齊。
這個技術選擇透露了一個清晰的價值判斷:理解人和理解物理世界,在認知架構上應該是平權的,甚至人的優先順序更高。
為什麼?因為落地節奏不同。
物理世界太複雜,泛化太難。一個在80公分高的桌子上訓練好的抓取模型,換到75公分的桌子上就可能失效。要在所有家庭、所有物品、所有光照條件下做到物理智慧的通用,李達認為短期內難以實現。
但人的理解模型不一樣。雖然人也複雜,但人的行為在單個家庭裡是有規律的。一個人每天喝水的杯子、回家的時間、說話的語氣,都有跡可循。如果機器人能先在一個具體的家庭裡把「這個人」理解清楚,它的可用性就會迅速提升。
可用性上去了,使用者的使用頻率也就能夠提升,拿著這些基於使用者實際反饋的資料,星熾的機器人也可以藉由這些和自家本體強耦合的真機資料,去進一步提升具身大腦的能力。
不追求一個模型解決全宇宙的問題,先讓機器人在一戶人家裏不出錯、不惹人煩、偶爾讓人覺得貼心。這個目標比通用物理智慧近得多。
PULSE 端雲結合的落地策略也印證了這一點,雲端負責全域性迭代,端側跑測試時適應——機器人在使用中遇到新分佈的資料,直接在本地做調優,不用等雲端回傳。這種設計天然適配家庭場景:每個家庭都不一樣,每個家庭的機器人都應該長出自己的理解模型。
說到底,物理智慧解決的是「能不能做到」,而人的理解模型解決的是「該不該做、什麼時候做、怎麼做才合適」。在家庭這個容錯率極低的環境裡,後者的優先順序恐怕還要再往前排一排。
這可能也是李達想表達的最核心的一句話:具身智慧在家庭落地的關鍵,不是讓機器人更像一個萬能工具,而是讓它更像一個懂得察言觀色的夥伴。
以下是 AI 科技評論和李達的對談實錄,AI 科技評論做了不變原意的編撰。
▎AI 科技評論:能為我們講講 PULSE 架構的特點嗎?
李達:PULSE這個名字我們其實是有些寓意的。一方面,我們希望它是一個永續的、能夠和人的價值對齊,並能夠持續演進的系統。另一方面,"PULSE"這個詞本身也有脈搏的意思。我們覺得機器人有了PULSE之後,就有了生命,也就能夠真正地伴隨使用者一起成長。
如果用幾個詞介紹 PULSE 的核心閉環,就是:看懂環境,理解使用者,雙軌推演,接受反饋,持續進化。
當前行業內具身世界模型更關注環境動力學,也就是關注周圍物理環境的演變。但是星熾動力主打 C 端家庭場景,就離不開和人的互動。所以我們希望能夠讓機器人具備「社會屬性」。
因此,我們在構建PULSE世界動作模型時,跨出了行業的第一步:不僅推演物理環境的變化,更要把「使用者狀態的變化」也推演出來。機器人在採取行動前,不僅要算清「杯子會不會掉」,還要推演出「這個舉動會不會打擾到主人」。
我們最終的目的,是賦予機器人真正的「心智」,但什麼是心智呢?人的心智,是他在一個團體當中,我應該知道怎麼去做才能更好的融入團體。所以我們也希望機器人不僅可以執行命令,還要懂得主動預判你的需求,貼合你的偏好,並且極其剋制地尊重你的家庭邊界等等。
▎AI 科技評論:這可能和做情感還不太一樣。
李達:純粹的「情感互動」往往停留在語言層面,通過聊天提供情緒價值和陪伴;而我們在星熾動力要做的是通過「心智理論(ToM)」,將家庭場景中高度複雜的「個性化」,轉化為一個可計算、可訓練、可驗證的數學模型。
這種基於心智的個性化模型,核心錨定在三個維度:信念(Belief)、意圖(Intention)和偏好(Preference)。
偏好依賴於機器人的長期情境記憶,而「信念」則是機器人理解人類認知偏差的關鍵。我舉個非常經典的家庭場景:男主人把牛奶放進微波爐加熱後離開,女主人隨後將其取出。此時,不知情的男主人腦海中就產生了一個「牛奶還在微波爐裡」的虛假信念(False Belief)。當他再次走向微波爐時,具備心智模型的機器人就能精準識別出這種「資訊差」,主動出聲提示甚至直接遞上牛奶,完成認知糾偏。
而在「意圖」層面,我們不再滿足於機器人只能聽懂直接指令,而是要求它具備兩項核心能力:一是「主動預判」,即通過使用者的行為動作提前推斷其潛在需求,做到「眼裏有活」;二是結合「偏好對齊」,評估機器人的執行動作和分寸,是否真正符合該使用者的心理期望。
爲了支撐這套複雜的認知中樞,在前期構建使用者狀態表徵時,我們引入了基於自解釋增強的多模態大模型來進行底層建模。
▎AI 科技評論:要做個性化,記憶肯定是很重要的。
李達:是的,記憶是個性化的基石。爲了兼顧機器人響應的低延遲與理解的深度,我們在PULSE的記憶模組上,設計了一套自適應任務複雜度的「三層記憶架構」:結構化規則層、RAG(檢索增強生成)語義層,以及底層的引數化模型層。
比如最直觀的結構化規則層,負責處理高確定性的物理時空檢索。當用戶問「我的剪刀呢?」,這是一個精準匹配的尋物指令,系統無需去啟用龐大的底層模型做深層表徵挖掘,直接在規則記憶庫中呼叫即可。
但如果使用者的指令是模糊或高度意圖化的,比如只說了一句「幫我倒杯水」,這就觸及了「RAG語義層」。光靠規則是無法匹配這句指令的,系統需要通過 RAG 從過往的歷史互動切片(Episodic Memory)中,檢索出與「倒水」相關的語境與習慣(比如用什麼杯子、常喝的溫度),以此對齊當前意圖。
當面對更為複雜的長尾場景、深層的情感共鳴,甚至遇到毫無歷史規則可循的突發狀況(Zero-shot)時,就需要「底層模型層」的重度介入。通過大模型的認知推理與泛化能力,對長期沉澱的使用者行為進行深度的因果歸因與價值挖掘。這種層層遞進的設計,確保了我們的機器人既能做到「極速響應」,又能做到「深思熟慮」。
▎AI 科技評論:不僅有記憶,還得有更好的上下文語境理解。
李達:對的,在家庭真實互動中,一句看似簡單的「給我倒杯水」,本質上是一個「高維且高度模糊」的指令。它隱含了海量的決策分支:水溫多少?什麼杯子?純淨水還是電解質水?這些資訊無法單純靠死記硬背來提取,機器人必須具備基於時空上下文的意圖消歧能力。
這種能力的底層支撐,是我們PULSE架構中的「室內態勢協同感知」模組。比如,當用戶大汗淋漓地推開家門說「倒杯水」,機器人不應該只是機械地去接一杯溫水,它需要瞬間完成兩個維度的態勢融合:
第一是物理環境感知,通過物聯網或環境感測器,獲取當前的極熱天氣與室內高溫狀態;第二是使用者狀態感知,通過第一視角的視覺模型捕捉「滿身是汗」的特徵,甚至結合毫米波雷達提取呼吸心率等生理訊號。
獲取這些多源異構資料在硬體層面並不難,真正的技術壁壘在於後端的多模態融合與跨域決策。基於這套感知,機器人不僅會決定遞上一杯補充電解質的運動飲料,還會聯動全屋智慧生態——比如我們目前已經與海爾智家、塗鴉智慧深度打通,機器人可以自主指令空調下調溫度。
因此,我們把室內態勢感知明確劃分爲物理環境和使用者狀態兩個維度。這兩部分的感知結果,將共同作為輸入,接入後續的世界動作模型。而這正是我們提出的"雙軌世界模型"的核心:既要對物理世界的演變進行推演,也要對使用者狀態的變化進行推演。只有將這兩者並行處理,機器人才能在家庭場景中真正理解人的需求。
▎AI 科技評論:另一方面其實對於具身來講,只有正確資料是不是足夠了?
李達:遠遠不夠。在具身智慧的真實落地中,「正確的常識」只能保證機器人能走通基本流程,而真正的護城河,恰恰是那些「錯誤資料」、「糾偏資料」以及「長尾的分佈外資料(OOD)」。機器人在使用者即時糾錯中產生的反饋資料,纔是我們做後訓練(Post-training)最珍貴的燃料。
在PULSE架構的資料迴流設計中,我們將這些反饋分成了兩條線處理:一條是雲端的全域性迭代,用於基礎大模型能力的長期對齊與泛化;但更關鍵的是另一條線——端側的測試時適應(TTA, Test-Time Adaptation)。機器人必須具備實時的不確定性估計(Uncertainty Estimation)與OOD檢測能力,一旦識別出歧義資料,就能快速讓模型適應新的資料分佈。這對機器人的糾偏速度要求很高,因為家庭場景裡使用者的心理容錯率極低——錯一次,可能就被退貨或閒置。
所以在策略上,我們就需要非常謹慎,不能因為歷史資料裡使用者曾經這麼做過,就替使用者直接把任務完成了。人的狀態有起伏,情緒可能多變。當機器人分析出當前執行某項任務的不確定性較高時,應該主動詢問使用者:"我幫您把這件事做了,行不行?"如果使用者同意,再執行;如果使用者表現出不耐煩,就靜默處理。
最理想的閉環是,機器人在完成每一個決策或動作後,能夠實時捕獲使用者的多模態顯隱式反饋。無論是憤怒的微表情、不耐煩的語氣,還是豎起大拇指誇一句「你真棒」,系統都會將這些自然流露的訊號回傳,轉化為偏好對齊模型中的正負獎勵。這纔是具身大腦「越用越聰明、越用越懂分寸」的本質路徑。
▎AI 科技評論:後訓練對你們來說是一個很重要的策略。
李達:我覺得後訓練肯定很重要,但這個要分時期來看。
從認知仿生學的角度來看,人類成長是一個增量學習的過程,我們在掌握一項新技能時,是基於已有的常識基座進行區域性的突觸連結調整,而不是把從小到大的所有記憶翻出來「全量重訓」一遍。具身大模型的後訓練,本質上就是模擬這種人類的「終身學習」機制——在新家庭、新場景中,以極低的算力成本對齊新的偏好。
但我們也非常客觀看待現階段的技術侷限。當後訓練走向極致,也就是真正意義上的「連續學習(Continual Learning)」時,不可避免會面臨災難性遺忘問題。
這是一個非常現實的風險:如果模型一直接收新知識、不斷進行微調,那些此前好不容易建立起來的基礎通用技能,會不會因為網路權重的覆寫而丟失?這就像俗話說的「狗熊掰棒子」,學了新的家庭習慣,卻忘了最基礎的物理常識。這種風險不僅存在,而且在現有的大模型架構中概率極高。因此,如何在「敏捷吸收新知」與「穩固歷史常識」之間建立有效的引數隔離與記憶重塑機制,也是我們當前在工程落地上投入極大精力去攻克的難點問題。
▎AI 科技評論:今天星熾動力怎麼看具身大腦的泛化?我們距離實現動作的即興和舉一反三還有多遠?
李達:當前行業距離真正泛化還有相當長的一段路要走。
現在很多VLA模型,一旦物理引數變了,比如實驗室精調時桌子高度是80公分,到真實家庭變成了75公分,它大概率就不知道該怎麼抓了,這說明現階段的泛化是非常脆弱的。如果大家只是在實驗室裏閉門造車,死磕演算法架構,這永遠是個無解的死迴圈,因為我們根本窮舉不完真實家庭裡千奇百怪的引數。
所以,星熾動力破局的思路,是緊緊貼合我們「本體+大腦+資料」三位一體的戰略飛輪。我們不寄希望於某種神奇的演算法能立刻實現通用泛化,我們走的是用規模換資料、用資料反哺模型泛化的務實路徑。所以星熾動力的模型,一定能率先在星熾自己的硬體本體上實現最穩健的泛化。
至於未來動作的即興編排,那是在我們的原子庫泛化能力足夠強之後,依靠上層大模型規劃和底層具身OS排程來自然實現的水到渠成。
▎AI 科技評論:隱私問題我們會怎麼考量?
李達:隱私絕對是C端家庭機器人的生死線。在星熾動力,我們對隱私的考量不僅停留在「獲取使用者知情同意(Consent)」這種合規底線上,更是將隱私保護機制直接原生地設計在了PULSE的技術架構裡,也就是所謂的「Privacy by Design(隱私即設計)」。
具體來說,我們通過「端側計算」和「模態解耦」來徹底切斷隱私洩露的源頭。
首先,在覈心的行為理解上,我們不需要把包含使用者真實面貌、穿著的RGB高清畫面傳回雲端。在端側,我們就直接將視覺流轉化爲了低維的骨架點(Skeleton/Pose)資訊。脫敏後的骨架序列,在行為識別演算法上的效能反而更好!因為衣著紋理、背景光影在很多時候是冗餘的噪聲,剝離這些反而讓模型更專注、更魯棒。
其次,對於人臉微表情、生理狀態這些極度敏感但算力要求不高的感知任務,我們全部在前端直接閉環處理。系統最終傳給雲端大腦的,只是幾個類似於「高興」、「疲憊」的結構化語義標籤,沒有任何原始影象。
環境資料也是同理。我們不需要上傳使用者家裏的照片來做預演,我們提取的是場景的結構化語義描述(Semantic Scene Graph)。雲端拿到的只是一組描述物體空間關係的文字和拓撲圖。
▎AI 科技評論:謝謝李博的分享,我們再問最後一個問題:星熾動力的 Mission 是什麼?
李達:讓機器人真正走進千家萬戶。我們聚焦家庭場景,希望打造一款在長期陪伴中不斷學習、越來越懂你的家庭夥伴機器人,讓機器人更自然地融入每個人的日常生活。