2026. 9. 11. 19:23ㆍ개발 도구/CVPR_Lab
2026.09.10
9월 2일 교수님께 연구 중인 과제 일부와 관련 논문인 IG-VLM(Image Grid Vision Language Model)을 전달받았고 첫 일주일 동안 과제 PDF와 논문을 읽으며 내용을 이해하는 데 집중했다.
9월 9일 랩미팅에서는 별도의 발표 자료 없이 PDF를 직접 펼쳐놓고 내가 이해한 내용을 설명했다. 모르는 부분을 질문하고 교수님과 박사님의 설명을 들으며 첫 번째 과제를 정리했다.
그리고 다음 날인 9월 10일, 박사님과 따로 이야기를 나눴다.
처음에는 교수님께서 말씀하신
“IG-VLM GitHub가 있으니 직접 모델을 돌려봐라.”
라는 다음 과제를 집중적으로 진행하려고 생각했다.
하지만 이야기를 나누면서 그보다 더 중요한 것을 하나 배우게 되었다.
바로 논문을 어떤 관점으로 읽어야 하는가였다.
지금까지 나는 논문을 ‘내용’ 중심으로 읽었다
처음 IG-VLM 논문을 받았을 때 내가 가장 먼저 생각했던 것은
“27페이지짜리 영어 논문을 어떻게 다 읽지?”
였다.
그래서 Abstract부터 Introduction, Related Works, Method, Experiments, Conclusion까지 하나씩 번역하고 내용을 이해하려고 했다.
그 과정 자체도 필요했다.
VLM이 무엇인지, Video QA가 무엇인지, Grid가 어떤 구조인지, 어떤 데이터셋을 사용하는지 등 기본적인 내용은 어느 정도 이해할 수 있게 되었다.
예를 들어 IG-VLM의 Grid에 대해서는 다음 정도로 이해하고 있었다.
비디오에서 여러 프레임을 선택하고, 그 프레임들을 시간 순서대로 하나의 Grid 이미지에 배치한다.
그리고 여러 장의 프레임이나 비디오 전체를 처리하는 대신 이렇게 만들어진 한 장의 Grid 이미지를 Image VLM에 입력한다.
그래서 나는 IG-VLM의 핵심을 대략 이렇게 이해하고 있었다.
비디오의 여러 시간 정보를 하나의 이미지에 담아 기존 Image VLM을 활용하면서도 Video QA를 수행하려는 방법이 아닐까?
박사님께서도 내가 이해하고 있는 방향은 맞다고 말씀해주셨다.
하지만 여기에서 한 단계 더 나아가야 했다.
논문의 내용을 설명할 수 있는 것과
논문의 연구 구조를 이해하는 것은 다르기 때문이다.
논문을 읽을 때 던져야 할 세 가지 질문
이번 미팅에서 가장 중요했던 내용이다.
박사님께서는 앞으로 IG-VLM 논문을 다시 보면서 세 가지 질문에 대한 나만의 답을 찾아보라고 하셨다.
그리고 이 질문은 IG-VLM에만 사용하는 것이 아니다.
앞으로 어떤 논문을 읽든 똑같이 적용할 수 있는 질문이다.
내가 이번 미팅에서 가장 크게 얻은 것은 바로 이 세 가지 기준이었다.
1. 이 논문의 메인 아이디어는 무엇이고, 무엇을 주장하려고 하는가?
첫 번째 질문이다.
“이 논문에서 메인 아이디어가 무엇이고, 결국 무엇을 주장하려고 하는가?”
가장 먼저 이것부터 잡아야 한다.
예를 들어 “IG-VLM은 비디오에서 여러 이미지를 뽑아서 Grid를 만드는 논문이다.” 라고 말하는 것은 방법에 대한 설명이다.
하지만 연구를 이해하려면 그보다 한 단계 더 나아가야 한다.
왜 Grid를 만들었는지,
기존 방식에는 어떤 문제가 있었는지,
그리고 이 방법을 이용해서 결국 연구자가 “우리는 이것이 더 좋다.” 라고 무엇을 주장하려고 하는지를 알아야 한다.
논문은 단순한 기술 설명서가 아니다.
연구자는 새로운 아이디어를 제시하고
“이 방법에는 이런 장점이 있다.”
“이 문제를 이렇게 해결할 수 있다.”
라는 주장을 한다.
그리고 논문의 나머지 부분은 결국 그 주장을 설득하기 위해 존재한다고 볼 수 있다.
그래서 앞으로 논문을 읽으면 가장 먼저 “그래서 이 논문의 한 문장짜리 주장은 뭐지?” 를 생각해보려고 한다.
IG-VLM 역시 다시 논문을 보면서 내가 막연하게 이해하고 있는 내용을 논문에 실제로 적힌 근거를 바탕으로 정확하게 정리해볼 예정이다.
2. 무엇과 비교했고, 왜 그것들과 비교했는가?
두 번째 질문은 비교 대상이다.
논문에서 새로운 방법을 제안했다고 해서
“우리 방법이 좋습니다.”
라고 말하는 것만으로는 연구가 완성되지 않는다.
다른 연구자가 봤을 때. “그래서 기존 방법보다 진짜 좋은가?” 라는 질문에 답해야 한다.
가장 쉽게 이를 증명하는 방법이 기존 연구와의 비교다.
그래서 실험 결과를 보면 IG-VLM뿐만 아니라 여러 Method가 함께 등장한다.
지금까지는 이런 표를 볼 때
“IG-VLM 숫자가 제일 높네.”
정도로 보는 경우가 많았다.
하지만 이제는 다르게 봐야 한다.
비교 대상이 누구인지
그 방법은 어떤 방법인지
IG-VLM과 무엇이 다른지
왜 수많은 연구 중 하필 이 연구와 비교했는지
를 생각해야 한다.
특히 박사님께서 강조하신 부분은 “왜 이 대상과 비교했는가?” 였다.
비교 대상은 아무 논문이나 가져오는 것이 아니다.
내 방법의 장점을 보여주기 위해 가장 적절한 상대를 선택하는 것이다.
그래서 비교 대상을 이해하면 오히려 첫 번째 질문인
“이 논문의 진짜 주장은 무엇인가?”
가 더 명확해질 수 있다.
예를 들어 어떤 연구들과 계속 비교하고 있다면,
그 비교를 통해 연구자가 강조하고 싶은 IG-VLM의 차별점이 무엇인지 역으로 파악할 수 있다.
그래서 실제로는
1번 → 2번
으로 끝나는 것이 아니라
1번 → 2번 → 다시 1번
으로 돌아갈 수도 있다.
비교 대상을 공부한 뒤 처음 생각했던 Main Idea를 수정할 수도 있는 것이다.
3. 평가 지표는 무엇을 의미하고, 무엇을 설명하려는가?
세 번째는 평가 방법과 평가 지표다.
비교 대상을 정했다면 다음 질문은 자연스럽다.
“그래서 무엇을 기준으로 어느 방법이 더 좋은지 판단하지?”
여기에서 평가 지표가 등장한다.
하지만 단순히 Metric 이름이나 숫자만 외우는 것이 목적은 아니다.
각 평가 지표에 대해
이 지표가 무엇을 측정하는지
값이 높으면 무엇이 좋은지
반대로 낮으면 무엇을 의미하는지
왜 이 실험에서 이 평가 지표를 사용했는지
이 지표를 통해 논문의 어떤 주장을 증명하려고 하는지
까지 이해해야 한다.
결국 숫자는 숫자 자체가 중요한 것이 아니다.
그 숫자가 논문의 주장을 뒷받침하는 근거가 되는 이유가 중요하다.
그래서 앞으로 Experiments의 Table을 볼 때도
“우리 모델 점수가 높네.”
에서 끝내지 않고
“이 평가 지표에서 점수가 높다는 것이 정확히 무엇을 의미하고, 그래서 IG-VLM의 어떤 장점을 증명하는가?”
까지 생각해봐야 한다.
결국 세 질문은 하나로 연결된다
이번 미팅에서 가장 중요한 부분은 이 세 질문이 서로 따로 존재하는 것이 아니라는 점이었다.
전체 흐름으로 보면 이렇게 된다.
① 무엇을 주장하는가?
Main Idea / Claim
↓
② 그 주장을 증명하기 위해 무엇과 비교하는가?
Comparison / Baseline
↓
③ 어떤 기준으로 더 좋다는 것을 증명하는가?
Evaluation / Metric
이 흐름이다.
다시 말하면,
“나는 이런 아이디어를 제안한다.”
↓
“기존의 이런 방법들과 비교해보겠다.”
↓
“이런 평가 기준을 사용했더니 실제로 이런 결과가 나왔다.”
↓
“따라서 내가 처음 주장했던 것이 의미가 있다.”
가 하나의 연구 흐름이다.
논문의 Introduction, Method, Experiments, Conclusion을 따로따로 보는 것이 아니라 이 흐름 하나로 연결해서 보는 것이다.
이 세 가지를 이해하면 연구의 시작과 끝이 보인다
박사님께서 이 세 가지 질문을 강조하신 이유는 단순히 IG-VLM 논문을 잘 이해하게 하기 위한 것이 아니었다.
나중에 내가 직접 연구를 할 때도 그대로 사용할 수 있기 때문이다.
예를 들어 내가 어떤 새로운 아이디어를 떠올렸다고 해보자.
그때도 똑같은 질문을 던질 수 있다.
내가 무엇을 주장하고 싶은가?
그것을 보여주려면 무엇과 비교해야 하는가?
어느 평가 지표를 사용해야 그것을 증명할 수 있는가?
이 세 가지가 명확하면
어떤 실험을 해야 하는지까지 자연스럽게 결정된다.
반대로 이것들이 명확하지 않은 상태에서 실험부터 시작하면
뭘 실험해야 하지?
뭐랑 비교하지?
어느 정도 결과가 나오면 좋은 거지?
이 결과가 의미가 있는 건가?
같은 문제를 계속 만나게 된다.
박사님께서는 실제 연구에서도 이런 기준이 모호하면 실험을 하면서 계속 헤매게 된다고 설명해주셨다.
그래서 이번 과제는 질문이 세 개뿐이지만 사실상 논문을 다시 제대로 읽어보라는 과제 에 가깝다.
IG-VLM을 다시 읽어보기
그래서 이번에는 IG-VLM 논문을 처음부터 다시 번역하면서 읽지는 않을 생각이다.
이미 한 번 전체 흐름을 읽었기 때문에 이제부터는 질문을 가지고 논문을 읽어보려고 한다.
내가 직접 답해야 할 것은 딱 세 가지다.
Question 1
IG-VLM의 Main Idea는 무엇이고 이 논문은 무엇을 주장하려고 하는가?
Question 2
IG-VLM은 어떤 연구들과 비교했고, 왜 그 연구들을 비교 대상으로 선택했는가?
Question 3
각 평가 방법과 평가 지표는 무엇을 의미하며, 그것을 통해 무엇을 증명하려고 하는가?
이 세 질문을 중심으로 다시
Abstract
Introduction
Related Works
Experiments
Tables
Conclusion
을 오가면서 근거를 찾아볼 생각이다.
그리고 중요한 것은 정답을 찾아 적는 것이 아니라 내가 이해한 답을 직접 만들어보는 것이다.
처음 작성한 답이 틀릴 수도 있다.
오히려 2번을 분석하다가 1번 답이 바뀔 수도 있고,
3번을 공부하다가 2번을 다시 수정할 수도 있다.
그렇게
1 → 2 → 3 → 1 → 2
를 반복하면서 논문에 대한 이해도를 높이는 것이 이번 공부의 핵심이다.
모든 논문을 앞으로 이런 방식으로 읽어보기
나는 이번에 배운 세 질문을 IG-VLM에만 사용하지 않고 앞으로 논문을 읽을 때의 기본 틀로 사용해보려고 한다.
논문 하나를 읽으면 최소한 다음 세 문장에는 답할 수 있어야 한다.
이 연구는 ○○를 주장한다.
이를 증명하기 위해 기존의 ○○와 비교했다.
그리고 ○○라는 평가 기준을 사용해 자신의 주장을 검증했다.
이 세 문장을 제대로 설명할 수 없다면 아직 그 논문의 연구 구조를 제대로 이해하지 못했다고 볼 수도 있을 것 같다.
특히 나중에 관심 있는 VLM이나 Physical AI 논문을 읽더라도 똑같이 적용할 수 있다.
연구 분야가 바뀌어도
Claim → Comparison → Evaluation
이라는 기본적인 사고 방식은 계속 사용할 수 있을 것이다.
논문을 빠르게 읽는 방법도 달라질 것 같다
이번 미팅에서는 논문을 빠르게 살펴보는 방법에 대해서도 이야기를 들었다.
수많은 논문을 처음부터 끝까지 전부 읽는 것은 현실적으로 어렵다.
그래서 먼저
Title → Abstract
를 확인한다.
Abstract에는 연구에서 정말 중요한 내용만 압축되어 있기 때문에 이것만 제대로 읽어도 이 논문이 내가 읽어볼 가치가 있는지 어느 정도 판단할 수 있다.
그래도 이해가 잘 되지 않는다면 Figure를 본다.
Figure는 글로 설명하기 어렵거나 복잡한 내용을 한 번에 보여주기 위해 존재하기 때문에 연구의 핵심 아이디어가 들어있는 경우가 많다.
결국 앞으로는
영어를 얼마나 많이 번역했는가
보다는
어떤 질문을 가지고 어떤 부분을 읽었는가
가 더 중요할 것 같다.
연구실에서의 다음 단계
이번 박사님 미팅과 별개로 교수님께 받은 과제도 계속 진행한다.
9월 9일 랩미팅에서 교수님께서는 IG-VLM의 GitHub가 공개되어 있으니 직접 모델을 실행해보라고 하셨다.
그래서 앞으로 한 주는 두 가지 흐름을 동시에 가져갈 계획이다.
첫 번째는 논문을 연구자의 관점에서 다시 읽는 것이다.
Main Idea
→ Comparison
→ Evaluation
세 질문에 대한 나만의 답을 만든다.
두 번째는 논문을 실제 코드로 확인하는 것이다.
IG-VLM Repository를 Clone하고 환경을 구축한 뒤 제공되는 Sample을 실행해본다.
그리고 가능하다면 논문에서 읽었던 Grid 방식이 실제 코드에서 어떻게 구현되어 있는지 까지 확인해보고 싶다.
단기간에 연구실에서 해보고 싶은 것
처음 학부연구생을 시작했을 때는
논문을 읽어보고 연구라는 것을 경험해보자.
정도의 생각이 컸다.
나는 현재 대학원 진학을 확정한 것도 아니고 우선은 개발자로 취업하는 것을 생각하고 있다.
그 과정에서 개발, AI, 공모전, 서비스 제작, 창업 등 여러 가지 경험을 해보고 있고 학부연구생 활동 역시 그 경험 중 하나로 시작했다.
하지만 일주일 동안 실제 논문을 읽고 이번 미팅까지 해보니 조금 더 해보고 싶은 생각이 생겼다.
단순히
“학부연구생을 했다.”
에서 끝내고 싶지는 않다.
가능하다면 연구실에서 하나의 작은 문제라도 직접 잡아보고,
문제 정의
→ 아이디어
→ 비교 대상 설정
→ 실험
→ 평가
→ 결과 분석
까지 한 번 경험해보고 싶다.
그리고 정말 좋은 결과가 나온다면 논문이나 연구 결과에 실제로 기여할 수 있다면 더 좋을 것 같다.
물론 연구가 항상 계획대로 결과가 나오는 것은 아니다.
그래서 지금부터 논문 작성 자체를 목표로 잡기보다는 연구 하나가 어떻게 시작되고 끝나는지를 직접 경험하는 것을 우선 목표로 두려고 한다.
이번 한 주의 목표
이번 주에는 욕심내서 이것저것 공부하기보다 명확한 결과물을 만들어보려고 한다.
IG-VLM 세 질문에 대한 내 답 만들기
1. 이 논문에서 메인 아이디어가 무엇이고 무엇을 주장하려고 하는가?
2. 그 주장을 보여주기 위해 무엇과 비교했고, 왜 그것들을 비교 대상으로 선택했는가?
3. 사용한 평가 지표는 무엇을 의미하고, 그 결과를 통해 무엇을 설명하려고 하는가?
그리고 이 세 가지를 단순히 자료를 복사해서 정리하는 것이 아니라
내가 박사님께 직접 설명할 수 있는 수준의 답으로 만드는 것.
이것이 이번 주 가장 중요한 목표다.
여기에 교수님께서 말씀하신 IG-VLM 모델까지 직접 실행해보면서 논문과 코드도 연결해볼 예정이다.
'개발 도구 > CVPR_Lab' 카테고리의 다른 글
| [학부연구생] 논문을 읽는 것에서 연구 질문을 찾는 것으로 — IG-VLM 이후의 다음 과제 (0) | 2026.09.17 |
|---|---|
| [학부연구생] IG-VLM 직접 실행해보기 — 논문의 아이디어를 코드로 따라가다 (0) | 2026.09.14 |
| [학부연구생] IG-VLM을 다시 읽다 — 논문을 이해하는 3가지 질문 (0) | 2026.09.14 |
| IG-VLM에서 사용한 10개 Benchmark 간단 정리 (1) | 2026.09.13 |
| 학부연구생 첫 일주일: 연구 과제와 IG-VLM 논문을 읽으며 연구를 이해해보기 (0) | 2026.09.10 |