跳至主要內容區域 跳至頁尾區塊

智慧團隊型機器人與人機協作研究中心

多模態數位孿生與人機互動技術

照護機器人的強化學習方法

計畫主持人: 謝秉均

計畫背景

居家與照護環境中,重複性、具時效性且安全要求高的任務相當多,例如運送物資、取送藥品,以及處理日常用品。機器人有潛力減輕照護人員的工作負擔,並提升服務的一致性。然而,實際部署仍面臨許多挑戰,因為照護環境具有高度動態性,物品種類多元,而真實世界中的機器人訓練成本高且伴隨風險。

本計畫的動機來自三項核心需求。第一,機器人必須能在不頻繁重新訓練的情況下,泛化至未見過的物品與任務。第二,機器人必須能將來自模擬環境或其他領域的知識轉移至真實居家或醫院場域,因為在這些環境中蒐集資料不僅昂貴,也可能帶來安全風險。第三,機器人的行為必須具可預測性並接近人類行為模式,使照護人員與受眾能夠更安心、舒適且安全地與其協作。

研究目標

本計畫的主要目標是發展以強化學習為基礎的機器人系統,使其能在居家環境、醫院、照護中心等協助日常工作。第一個目標是實現零樣本操作能力,使機器手臂能在沒有額外針對特定任務訓練的情況下,處理不熟悉的相關日常物品。第二個目標是提升從模擬環境或其他來源領域轉移至真實機器人平台的能力,以降低真實世界資料蒐集的成本與風險。第三個目標是讓機器人的行為更接近人類、更可預測,並更容易被照護者與使用者接受。整體而言,這些目標旨在支援藥品遞送、日常用品搬運,以及例行物流協助等實際照護應用,同時維持機器人的適應性、效率與自然的人機互動能力。

技術方法

本計畫的方法包含三個相互連結的組成部分。首先,計畫將研究機器人操作任務中的零樣本強化學習泛化能力。機器手臂將透過模擬環境進行預訓練,並採用基於 forward-backward representations 的無獎勵預訓練方法,使其能在導入特定任務獎勵之前,先學習通用型的操作能力。此方法將有助於將所學技能轉移到涉及未見過物品與新照護情境的真實世界任務。其次,本計畫將發展跨領域強化學習方法,以縮小來源領域與目標領域之間的差距。這包括在狀態、動作、機器人形態或具身條件不同時,學習領域之間的對應關係。具體而言,計畫將使用跨領域 Bellman 一致性來引導對應關係的學習,並結合混合式評論器與自適應權重機制,以平衡來源領域與目標領域價值函數的重要性。第三,計畫將納入類人強化學習方法。人類示範將透過巨集動作量化萃取為可重複使用的巨集動作,並將機器人決策表述為軌跡最佳化問題,使其動作序列更符合人類行為模式。上述方法將在模擬與真實居家環境或醫院,以物品取放、擺放與遞送等照護相關任務進行評估。

創新

本計畫的創新在於將零樣本泛化、跨領域轉移與類人式行為學習整合為輔助機器人的強化學習框架。不同於針對每一種物品或環境分別訓練機器人,本計畫強調可延伸至未見過相關物品的通用操作能力。此外,本計畫也處理真實世界機器人資料有限的實務挑戰,透過從低成本且資料豐富的來源領域轉移知識至高成本的目標領域,提升部署可行性。跨領域強化學習的部分,將以跨領域 Bellman 一致性與自適應混合式評論器作為理論基礎。除此之外,本計畫不僅追求任務成功率,也重視機器人行為是否接近人類動作模式,並透過巨集動作與軌跡最佳化,使機器人在以人為中心的照護環境中成為更自然的合作夥伴。

預期成果

本計畫預期將貢獻一套用於輔助機器人的強化學習框架,使機器人能具備泛化、轉移與有效協作的能力。首先,本計畫將提出零樣本機器人操作方法,使機器人能處理多樣化的照護相關物品,支援藥品處理與日常用品遞送等應用。其次,本計畫將推進跨領域強化學習方法,透過利用模擬環境與其他來源領域的知識,降低對昂貴真實世界機器人訓練的依賴。第三,本計畫將貢獻類人式強化學習技術,使機器人動作更具可預測性、可解釋性,並更適合人機協作。更廣泛而言,本計畫將提供演算法、實驗基準與設計原則,以支持機器人在居家環境與醫院照護環境的部署。在這些場域中,適應性、安全性與自然互動能力皆至關重要。