<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Robot Foundation Models | Scientific Discovery Lab</title><link>https://sd-lab-page.github.io/ko/tags/robot-foundation-models/</link><atom:link href="https://sd-lab-page.github.io/ko/tags/robot-foundation-models/index.xml" rel="self" type="application/rss+xml"/><description>Robot Foundation Models</description><generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>ko-KR</language><lastBuildDate>Sat, 30 May 2026 00:00:00 +0000</lastBuildDate><image><url>https://sd-lab-page.github.io/media/icon_hu_77cf8b59efcb710e.png</url><title>Robot Foundation Models</title><link>https://sd-lab-page.github.io/ko/tags/robot-foundation-models/</link></image><item><title>사족보행 및 휴머노이드 로봇을 위한 VLA 모델</title><link>https://sd-lab-page.github.io/ko/projects/vla/</link><pubDate>Sat, 30 May 2026 00:00:00 +0000</pubDate><guid>https://sd-lab-page.github.io/ko/projects/vla/</guid><description>&lt;h2 id="프로젝트-목표"&gt;프로젝트 목표&lt;/h2&gt;
&lt;p&gt;이 프로젝트에서는 사족보행 로봇과 휴머노이드 로봇을 위한 Vision-Language-Action(VLA) 모델을 개발하고 있습니다. 시각 장면을 이해하고, 자연어 지시를 해석하고, 물리적 환경을 추론하여 보행, 전신 움직임, 장기 작업 계획에 필요한 로봇별 행동을 생성하는 체화 AI 시스템을 연구하고 있습니다.&lt;/p&gt;
&lt;p&gt;개별 인식, 내비게이션, 제어 모듈을 따로 구성하는 방식을 넘어 통합된 로봇 지능 체계를 만드는 것이 목표입니다. 사족보행 로봇과 휴머노이드 로봇이 시각·언어 추론을 통해 환경의 상황을 이해하고, 물리적으로 가능한 행동을 판단하고, 구체적인 작업을 수행하도록 설계하고 있습니다.&lt;/p&gt;
&lt;h2 id="연구-배경"&gt;연구 배경&lt;/h2&gt;
&lt;p&gt;최근 Vision-Language Model(VLM)은 물체 인식, 장면 설명, 이미지와 텍스트를 활용한 추론에서 높은 성능을 보여주고 있습니다. 그러나 로봇에는 시각적 추론만으로 충분하지 않습니다. 인식과 언어를 실제 물리 행동으로 연결해야 하며, 물체가 무엇인지뿐 아니라 접근하거나 잡거나 피하거나 열고 옮길 수 있는지까지 판단해야 합니다.&lt;/p&gt;
&lt;p&gt;사족보행 로봇과 휴머노이드 로봇은 서로 다른 신체 구조 때문에 같은 언어 지시도 다르게 수행해야 합니다. 사족보행 로봇은 계단, 비정형 지형, 좁은 통로, 넓은 실내외 공간을 안정적으로 이동할 수 있지만 조작 능력이 제한적입니다. 반면 휴머노이드 로봇은 문을 열고 도구와 물체를 다룰 수 있지만 전신 균형, 동작 계획, 조작 제어가 더욱 복잡합니다.&lt;/p&gt;
&lt;p&gt;예를 들어 “위쪽 선반에 있는 물체를 확인하라”는 지시에 대해 사족보행 로봇은 해당 위치로 이동해 여러 시점에서 선반을 관찰하고 상태를 보고해야 합니다. 휴머노이드 로봇은 선반까지 걸어가 자세를 조정하고 팔을 뻗어 물체를 잡거나 옮겨야 할 수 있습니다. 범용 VLA 시스템은 공통된 작업 의미와 로봇 신체에 따른 행동 요구를 함께 이해해야 합니다.&lt;/p&gt;
&lt;h2 id="연구-방법"&gt;연구 방법&lt;/h2&gt;
&lt;h3 id="vla-로봇-지능"&gt;VLA 로봇 지능&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;언어 기반 시각 이해&lt;/strong&gt;: 자연어 지시를 로봇 카메라 영상, 물체 위치, 공간 관계, 작업에 필요한 시각 정보와 연결하는 모델을 개발하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;체화 행동 추론&lt;/strong&gt;: 시각·언어 이해를 보행, 회전, 관찰, 뻗기, 파지, 상호작용처럼 실제 실행 가능한 로봇 행동으로 변환하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;장기 작업 분해&lt;/strong&gt;: 높은 수준의 사용자 지시를 사족보행 또는 휴머노이드 로봇이 순차적으로 수행할 수 있는 행동 단계로 분해하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;행동 가능성 인식&lt;/strong&gt;: 시각 관찰을 바탕으로 통과, 회피, 등반, 접근, 파지, 개폐, 이동, 조작 가능성을 추정하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;실패 인식형 VLA 제어&lt;/strong&gt;: 현재 관찰만으로 작업을 완료할 수 없는 상황을 감지하고 재계획, 추가 인식, 대체 행동을 수행하도록 연구하고 있습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="사족보행-로봇-지능"&gt;사족보행 로봇 지능&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;언어 기반 이동&lt;/strong&gt;: 자연어 명령에 따라 이동, 점검, 탐색, 공간 조사를 수행하는 사족보행 로봇을 개발하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;지형 인식 내비게이션&lt;/strong&gt;: 시각, 고유수용감각, 환경 정보를 결합하여 계단, 경사로, 복잡한 공간, 좁은 길, 비정형 지형을 이동하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;능동적 시각 점검&lt;/strong&gt;: 로봇이 몸과 카메라 시점을 능동적으로 움직여 물체, 공간, 구조물, 장애물, 불확실한 영역을 관찰하도록 연구하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;의미 기반 환경 탐색&lt;/strong&gt;: 기하 구조뿐 아니라 물체 범주, 공간 기능, 랜드마크, 작업 관련 영역을 중심으로 환경을 매핑하고 탐색하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;사람 중심 이동&lt;/strong&gt;: 사람, 가구, 문, 복도, 동적 장애물이 있는 환경에서 안전하게 이동하는 행동을 개발하고 있습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="휴머노이드-로봇-지능"&gt;휴머노이드 로봇 지능&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;전신 VLA 제어&lt;/strong&gt;: 언어와 시각 정보를 머리, 몸통, 팔, 손, 다리의 협응 동작으로 연결하는 VLA 모델을 개발하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;양손 조작&lt;/strong&gt;: 두 손을 이용한 물체 취급, 도구 사용, 운반, 개폐, 밀기, 당기기, 협응 조작을 학습하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;인간 환경과의 상호작용&lt;/strong&gt;: 문, 손잡이, 선반, 스위치, 수납장, 탁자, 의자, 도구처럼 사람의 신체에 맞춰 설계된 환경을 다루도록 연구하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;자세·균형 인식 행동&lt;/strong&gt;: 무게중심, 도달 가능 범위, 발 위치, 지지면, 전신 안정성을 고려한 행동을 생성하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;사회적 맥락의 로봇 행동&lt;/strong&gt;: 사람이 함께 있는 공간에서 이동, 몸짓, 접근, 물체 전달, 상호작용을 자연스럽고 안전하게 수행하는 방법을 연구하고 있습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="slam과-공간-이해"&gt;SLAM과 공간 이해&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;VLA 로봇을 위한 Semantic SLAM&lt;/strong&gt;: 위치 추정, 공간 기억, 물체 지도, 장기 작업 수행을 지원하는 VLA 시스템의 구성 요소로 Semantic SLAM을 활용하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;언어 기반 지도 질의&lt;/strong&gt;: “계단 근처의 방”, “탁자 뒤의 물체”, “왼쪽 문”과 같은 표현을 지도 기반 공간 표현과 연결하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;다중 시점 장면 이해&lt;/strong&gt;: 서로 다른 로봇 시점의 관찰을 결합하여 물체 위치 추정, 장면 재구성, 환경 인식을 개선하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;지도 기반 작업 계획&lt;/strong&gt;: 사족보행 및 휴머노이드 로봇의 이동, 점검, 물체 탐색, 경로 계획, 작업 순서를 공간 지도로 지원하고 있습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;동적 지도 갱신&lt;/strong&gt;: 물체 이동, 문 개폐, 경로 차단, 로봇 행동에 따른 환경 변화를 공간·의미 지도에 반영하고 있습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="현재-구현-단계"&gt;현재 구현 단계&lt;/h2&gt;
&lt;p&gt;현재는 사족보행 및 휴머노이드 로봇 지능을 위한 VLA 프레임워크를 정의하고 구현하고 있습니다. 초기 시스템은 로봇 비전, 자연어 지시의 공간적 연결, 의미 지도, 로봇 신체에 맞춘 행동 생성을 중심으로 구성하고 있습니다.&lt;/p&gt;
&lt;p&gt;사족보행 로봇에서는 언어 기반 내비게이션, 능동적 시각 점검, 장면 탐색, 지형 인식 이동, Semantic SLAM 연동에 집중하고 있습니다. 이를 통해 복잡한 환경을 이동하면서 물리적 공간과 연결된 언어 지시를 이해하는 기반을 구축하고 있습니다.&lt;/p&gt;
&lt;p&gt;휴머노이드 로봇에서는 시각·언어 기반 뻗기, 물체 상호작용, 전신 작업 수행, 조작 중심의 장면 이해를 연구하고 있습니다. 팔과 손, 자세 제어, 물리적 상호작용이 필요한 작업을 인간 중심 환경에서 수행하기 위한 기반을 마련하고 있습니다.&lt;/p&gt;
&lt;h2 id="향후-연구-방향"&gt;향후 연구 방향&lt;/h2&gt;
&lt;p&gt;향후에는 서로 다른 로봇 신체, 환경, 작업 영역에 적용할 수 있는 범용 VLA 로봇 시스템으로 확장할 계획입니다. 사족보행과 휴머노이드 플랫폼이 공통으로 활용할 수 있는 시각·언어 기반 로봇 파운데이션 모델을 개발하되, 실제 행동은 각 신체 구조에 맞는 제어 헤드를 통해 생성하는 방향을 연구하고 있습니다.&lt;/p&gt;
&lt;p&gt;또한 VLA 로봇 정책을 위한 Sim-to-Real 학습 파이프라인을 구축할 계획입니다. 시뮬레이션에서는 다양한 환경, 드문 실패 사례, 대규모 작업 변형을 생성하고, 실제 로봇 실험에서는 물리적 제약, 센서 노이즈, 접촉 불확실성, 동적 환경에서도 정책이 안정적으로 작동하는지 검증하고자 합니다.&lt;/p&gt;</description></item></channel></rss>