동적 무한 스크롤 형태로 피드가 로드되어 기존의 단순 정적 HTTP Request 라이브러리(requests) 활용 불가
해결
가상 브라우저 자동화: 세션 인증 흐름을 유지하고 스크롤 다운 트리거 이벤트를 수동 모방하기 위해 Selenium WebDriver 구동 엔진 설계
하이브리드 파싱 최적화: Selenium 단독 브라우저 렌더링에 따른 심각한 CPU/메모리 부하를 줄이기 위해, 브라우저가 읽어온 동적 HTML 문자열을 메모리로 즉시 가로채 BeautifulSoup으로 고속 정적 텍스트 파싱을 동시 병행 처리하는 하이브리드 수집 구조 고안
성과
연구 데이터 자산 확보: 대량의 소셜 피드 게시글 및 댓글 텍스트 정제, 해시태그 파싱을 자동화하여 자연어 분석 분석을 위한 대형 데이터셋 구축 기여