02 / DATA
Brand Website Crawler + Analysis
브랜드 웹사이트를 크롤링해 상품 데이터를 수집·구조화하고, 트렌드와 인사이트를 도출
ANALYSIS
BRAND SITE — PRODUCT DETAIL
01All Clothing — T-Shirts & Tanks — PRODUCT A
02WEBSITE PAGE03PRODUCT A$00Double-knit cotton crewneck, mid-weight
04ESSENTIAL 11 + LIMITED 3041 COLORS · #000000
05DETAILS — CONTENTSContent: 100% cotton / Care: Machine wash / Imported
- 01카테고리
- 상단 breadcrumb 경로의 가운데 단계가 곧 카테고리입니다. 페이지마다 위치가 같아서 Top / Dress / Pant 같은 분류를 손대지 않고 그대로 가져올 수 있습니다.
- All Clothing — T-Shirts & Tanks — PRODUCT A
- 02웹사이트 페이지
- 대표 컷 이미지 주소를 확보해 엑셀에서 바로 열리도록 연결했습니다. 나중에 숫자만 보면 어떤 물건인지 감이 안 오기 때문에, 사진을 별도로 저장했습니다.
- Website page → image URL
- 03제품명 · 가격 · 설명
- 정가와 할인가를 나눠 담고, 한 줄 설명은 뒤에서 Woven / Knit 판정의 근거로 씁니다.
- PRODUCT A / $00 / "Double-knit cotton crewneck…"
- 04컬러 수 · 스타일 번호
- 스와치 개수를 세어 컬러 수로 환산했습니다. Essential과 Limited Edition이 나뉘어 있어도 합산합니다. 우측 상단 번호는 스타일 식별자로 같이 저장합니다.
- Essential 11 + Limited 30 = 41 colors / #000000
- 05혼용률
- Details 탭을 눌러야 열리는 영역이라, 수집할 때 이 탭을 자동으로 열어준 뒤에 텍스트를 읽었습니다.
- Content: 100% cotton / Care: Machine wash / Imported
- PUBLIC PRODUCT PAGE
- →COLLECT
- →CATEGORY / IMAGE / PRICE / COLOR / CONTENTS
- →NORMALIZE
- →WOVEN / KNIT / MATERIAL GROUP
- →ANALYSIS
- →TREND & INSIGHT
문제
바이어가 실제로 어떤 소재를 얼마나 쓰는지, 라인업이 어떻게 구성되는지를 벤더 입장에서 확인할 방법이 없었다. 내부 자료는 받을 수 없고, 공개된 판매 페이지에 정보는 있지만 흩어져 있어 그대로는 쓸 수 없었다.
기존 프로세스
- 01제품 페이지를 하나씩 연다
- 02필요한 값을 눈으로 찾는다
- 03엑셀에 옮겨 적는다
- 04표기가 제각각이라 집계가 안 된다
- 05결국 감으로 판단한다
- 06한 건에 약 1분, 721건이면 약 12시간
만든 것
- 제품 페이지에서 카테고리·제품명·가격·컬러 수·혼용률 다섯 개 필드를 고정 위치로 정의해 추출
- 수집 단계에서는 해석하지 않고 원문 그대로 저장. 기준이 바뀌어도 재수집이 필요 없게 설계
- 표기만 다른 동일 조성을 하나로 통일 (괄호 주석·안감 표기·쉼표 위치 차이 정규화)
- 사이트에 표기되지 않는 Woven/Knit을 제품 설명·카테고리·조성을 함께 읽어 자동 판정
- 지배 섬유 기준 21개 소재군으로 분류하고 소재군별 시트로 분리
결과
- 721개 제품 · 14개 고정 필드 · 소재군별 21개 시트로 정리
- Woven 425 / Knit 290 / 판정 제외 6
- 소재 구성, 카테고리 비율, 시즌 구성을 수치로 확인 가능해짐
공개된 판매 페이지 정보 기반 · 자동 분류 결과로 일부 오차 가능