AI · Reinforcement Learning · VLA

Everything is a
trade-off relationship.

Today, you are so nice.

Best for A Balanced Best for B Objective A Objective B

Writing

Recent

수반행렬(Adjoint Matrix)

소행렬식(Minor Determinant) n\times n 정방행렬 A에서 어떤 원소 a_{ij}를 기준으로 i번째 행과 j번째 열을 제거한 뒤 남은 부분행렬의 determinant를 소행렬식이라고 한다. 이를 예를 들어 (1, 1) 원소의 소행렬식 위와 같은 행렬이 있을 때 1행과 1열을 제거한 행렬

[ML] Jacobian 2

서론 이 장에선는 Jacobian이 다루는 함수 구조에 대해서 자세히 알아본다. Jacobian shape 다변수 벡터 함수 ‭f: \mathbb{R}^n \to \mathbb{R}^m‬‭‬ ‭‬‭‬‭‬은 ‭n\times1 차원의 실수 성분을 입력받아 ‭m\times1‬개의 실수 성분을 출력하는 구조를

데이터의 크기를 나타내는 RMS

서론 신경망에 입력되는 observation에는 Joint Position, Joint Velocity, Linear Velocity, Angular Velocity, Projected Gravity, Previous Action 등 서로 다른 종류의 데이터가 존재한다. 예를 들어 어떤 observati

[ML] Jacobian 1

서론 고등학생때 배웠던 미분은 단순히 함수의 접선 기울기를 구하는 것에 그쳤다면 AI/ML 관점에서는 입력을 아주 조금 변화시켰을 때 출력은 얼마나 변화하는가에 대한 관점으로 바꾸어 생각해본다. 예를들어 x에 작은 변화량 \Delta x를 주어 x → x + \Delta x가 되었다하자. 그러면 출력의

회귀모델 MSE

서론 머신러닝에서 주식 가격, 내일의 온도, 혹은 자동차의 속도(velocity)처럼 연속적인 숫자를 예측하는 작업을 '회귀(Regression)'라고 한다. MSE는이 회귀 문제에서 모델이 얼마나 틀렸는지 나타내는 평가지표이다. 그럼 MSE의 특징에 대해서 조금 더 알아보자. MSE 한계 MSE의 한계

Output Data Normalization

서론 로봇의 여러 물리량을 하나의 신경망에서 예측하려고 한다. 정답 데이터가 모두 존재하며, 각 출력에 대해 MSE loss를 사용한다. 데이터는 크게 세 종류이다. 관절 action: 총 12차원이며 각 관절은 서로 다른 평균과 분산을 가진다. 정책은 각 상태에서 Gaussian distribution

EM 알고리즘 (작성중)

우리는 각 데이터가 어떤 군집에 속하는지 알 수가 없는 상황에서 비슷한 데이터끼리 여러 그룹으로 나누고 싶다. 이렇게 데이터의 라벨을 모르는 상태에서 어떻게 각 비슷한 데이터끼리 그룹으로 구분할 수 있을까? 여기서 우리가 관측한 데이터는 X, 각 데이터가 어느 군집에 속해있는지 나타내는 잠재변수를 Z라고

[2차시] Average Reward

서론 지금까지는 정책이 만들어내는 마르코프 체인을 장기적인 관점에서 분석하기 위한 이론적 기반을 살펴보았다. 정상분포와 에르고딕 성질을 통해, 정책을 충분히 오래 수행하면 각 상태를 얼마나 자주 방문하는지를 하나의 확률분포로 표현할 수 있음을 확인하였다. 그러나 상태를 얼마나 자주 방문하는지만으로는 정책

[3차시] Markov Decision Process

서론 평균보상에는 한계가 있었다. 에르고딕성이라는 강한 조건이 필요하고, 종료 상태가 존재하는 문제에서는 종료 이전의에 받은 보상이 무한한 시간 속에서 영향력이 점차 사라진다. 결국 보상을 '얼마나' 받았는지뿐 아니라 '언제' 받았는지까지 반영하는 새로운 평가 방식이 필요하다. 이번 시간에는 이 요구를

[1차시] Markov process

서론 강화학습의 목표는 “현재 상황에서 어떤 행동을 해야 미래에 더 좋은 결과를 얻을 수 있는가?” 이라고 볼 수 있다. 이 질문을 다루려면 먼저 시간에 따라 상태가 어떻게 변할지를 표현해야 한다. 하지만 미래의 상태는 정확히 정해져 있지 않고 확률적으로 변한다.(예를 들어 로봇이 앞으로 가려고 해도 바

Z-transform

연속 시스템은 변화율에 대한 관계식을 나타내는 미분방정식으로 표현되었다. 이산에서 "변화율"에 해당되는 가장 작은 간격이 1스텝이므로, 변화를 표현하는 최소 단위는 현재 값과 한 스텝 전 값의 차이, 즉 차분 y[n] - y[n-1] 이다. 미분이 차분으로 대체되므로, 시스템은 현재와 과거 값들 사이의

Pole이 시간영역에서 미치는 영향

목차 왜 이 장에서는 시스템의 해가 지수함수의 꼴이며 이때 Pole값이 시간응답에 미치는 영향에 대해 알아본다. 시스템의 해 e^{st} 이유 시스템은 일반적으로 미분방정식으로 기술된다. a_2 \ddot{y} + a_1 \dot{y} + a_0 y = 0 이 미분방정식은 \ddot{y},\ \dot{y

Explore

Browse by topic

172notes
11topics
2026년 9월 10일updated