TECHNOLOGY / OPERATING ARCHITECTURE
수집 지연과 오류를 줄이는 운영 기술.
상품을 여러 서버에서 나눠 수집하고, Syntrix Verify로 오류를 검수합니다. 사이트가 바뀌면 수집기를 수정하고, 검수자가 승인한 데이터를 고객 시스템에 전달합니다.
OPERATING ARCHITECTURE 운영 흐름 예시
수집부터 고객 시스템까지
- 01수집
작업을 나누어 실행
작업 큐 · 병렬 수집 · 실패 작업 재처리
- 02검증·분석
업무 기준으로 확인
규칙 검증 · LLM 보조 분석 · 검수할 의심 사례 정리
- 03최종 판단
검수자가 승인·반려
분석과 재수집 결과 확인 · 사람의 판단 이력 기록
- 04전달
고객 시스템에 연결
고객의 항목명·형식과 전달 주기 · API · DB · 파일 · 리포트
수집·검증·사람의 최종 판단을 거쳐 고객 시스템에 연결하는 구조입니다.
01 / Syntrix Verify
Syntrix Verify
신트릭스의 5단계 데이터 검수 시스템
가격 누락·형식 오류는 규칙으로, 상품 오분류·무관한 리뷰는 AI로 검수합니다. 검수자가 결과를 확인해 최종 승인합니다.
- 01
수집 건수·누락 · 재수집 대상 확인
규칙 - 02
자료형·필수값 · 빈값·형식 검사
규칙 - 03
가격 범위·급격한 변동·항목 간 일관성
규칙 - 04
분류·리뷰·감성 · 의심 사례 선별
LLM 보조 - 05검수자
최종 승인·반려
분석·판단 이력 기록
가격 누락 예시 · 누락된 작업 확인 → 재수집 → 검수자 승인 후 전달
검수 과정 예시 가상 데이터·분석
Syntrix Verify
| 수집 데이터 | 확인 기준 | 규칙 검사 |
|---|---|---|
| 상품 A · 가격129,000원 | 0보다 큰 숫자 | 통과 |
| 상품 B · 가격149,000원 | 필수값 존재 | 통과 |
| 상품 C · 재고12개 | 0 이상의 정수 | 통과 |
| 상품 D · 재고−2개 | 0 이상의 정수 | 검수 필요 |
LLM · 의미 검수
의심 분류- 상품명
- 노트북 거치대
- 수집된 분류
- 노트북
LLM 분석 예시 · 상품은 주변기기인데, 분류는 노트북 본체를 가리킵니다.
규칙 검사 뒤 상품명과 분류의 의미 불일치를 검수 대상으로 남깁니다.
규칙 검사와 LLM 분석 결과를 함께 확인합니다.
02 / 변경 대응
사이트가 바뀌면,
AI를 활용해
수집기를 수정합니다.
AI가 변경된 페이지 구조를 분석해 가격·재고를 다시 읽을 수집 경로를 제안합니다. 이 경로로 수집기를 수정하고, 실제로 필요한 값이 수집되는지 검증합니다.
01 / AI가 수집 경로 제안
값이 누락된 항목을 기준으로 AI가 페이지 구조를 분석합니다. 기존 경로를 대신할 새 경로를 찾습니다.
02 / 수집기에 수정안 적용
AI가 제안한 경로로 수집기를 수정합니다. 별도 환경에서 다시 실행해 값의 누락·형식 오류를 검사합니다.
03 / 검수 후 운영 반영
검수자가 재수집한 값과 검사 결과를 확인합니다. 승인한 수정안을 운영에 반영하고 변경 이력을 남깁니다.
AI CHANGE & RECOVERY 운영 흐름 예시
AI의 제안으로 수집기를 수정합니다
기존 수집 위치
.priceAI의 수집 경로 제안
[data-price]- 수집기 경로 변경
.price → [data-price]- 수정 후 재수집한 가격
- 149,000원
- 필수값 확인
- 값 있음 · 확인
승인한 수집기 변경만 운영에 반영
AI의 경로 제안을 수집기 수정에 활용하고, 재수집 결과를 검증합니다.
03 / 콘텐츠 분석
AI로 문맥을 읽고,
고객 의견을
세밀하게 분석합니다.
단어·규칙만으로 구분하기 어려운 표현을 AI로 분석합니다. 문장에 드러난 평가 대상과 이유를 읽고, 한 댓글에 섞인 여러 의견을 나눠 정리합니다.
공개 범위에 맞춘 수집
YouTube·TikTok·Instagram 등 채널별 공개 범위와 이용 정책을 확인해 수집 항목을 정합니다. 뉴스·공공데이터도 같은 방식으로 범위를 검토합니다.
문맥·평가 대상별 AI 분석
AI가 무엇을 평가하는지 구분하고, 대상별 의견과 글에 드러난 이유를 정리합니다. 검수자가 원문과 대조해 해석을 확인합니다.
분석 이력과 사용량 관리
분석 요청 수와 비용, 분석 결과와 검수 기록을 남깁니다. 처리 내역과 사용량을 함께 확인할 수 있습니다.
AI CONTENT ANALYSIS 운영 흐름 예시
AI가 문맥과 평가 대상을 읽습니다
가상 댓글 · AI 문맥 분석
“화질은 나쁘지 않은데, 들고 다니기엔 부담돼요.”
| 평가 대상 | 감성 | 원문 근거 |
|---|---|---|
| 화질 | 긍정 | 화질은 나쁘지 않은데 |
| 휴대성 | 부정 | 들고 다니기엔 부담돼요 |
문맥을 반영한 요약 초안
화질은 괜찮다는 평가, 휴대성에는 부담.
AI가 문맥에 따라 화질과 휴대성 평가를 구분합니다. 검수자가 원문을 대조합니다.
검수자가 원문과 분석 결과를 확인합니다. 자동으로 최종 결정에 사용하지 않습니다.
04 / 전달 기준
사용 중인 시스템에
맞춰 데이터를 전달합니다.
받는 시스템의 항목명·데이터 형식과 필요한 전달 주기를 확인합니다. 운영을 시작하기 전에 샘플 데이터로 실제 사용 형식에 맞는지 검토합니다.
수집 범위와 주기
대상 채널·국가·제품군, 필요한 항목과 수집 주기
데이터 규격과 검수
받는 시스템의 항목명·형식, 필수값·이상치 기준, 검수자의 승인 범위
전달과 운영 조건
전달 경로·주기, 접근 권한·보관 조건, 장애 대응 범위
대상 데이터와 고객 환경에 따라 적용 가능한 조건을 협의합니다.
SYSTEM DELIVERY 운영 흐름 예시
고객의 항목과 형식에 맞춥니다
입력 데이터
검수자가 승인한 상품 데이터| 수집 항목 | 고객의 항목명 예시 |
|---|---|
| 상품명 | → product_name |
| 가격 | → price |
| 재고 | → stock |
협의한 경로·주기로 전달
- API
- DB
- 파일
- 리포트
상품명·가격·재고를 고객의 항목명에 맞추고, 협의한 경로와 주기로 전달합니다.
05 / 분산 수집
한 채널도 나눠 수집해,
전체 수집 시간을 줄입니다.
한 채널의 상품도 여러 EC2 서버에 나눠 동시에 수집합니다. 고객이 가격을 확인하려는 시점과 상품 수에 맞춰 수집 작업을 설계합니다.
한 채널의 상품을 나눠 수집
상품 목록을 작업 큐로 나누고 여러 EC2에서 동시에 실행합니다. 한 서버가 순서대로 처리할 때의 대기 시간을 줄입니다.
사이트별 수집기 개발·운영
자체 Headless 수집기를 사이트 구조에 맞춰 개발합니다. 필요한 항목을 추출하고 수집 결과를 검증합니다.
완료 결과 보존·부분 재처리
완료한 결과는 유지하고 필요한 작업만 다시 실행합니다. 수집한 값은 검증 단계로 보냅니다.
수집 시점·주기·병렬 실행 규모는 사이트 이용 조건에 맞춰 정합니다. 실제 완료 시점은 상품 수와 검증 범위에 따라 달라집니다.
PARALLEL COLLECTION 가상 작업 예시
한 채널의 상품을 나눠 수집합니다
한 채널 · 상품 300개 → 100개씩 나눠 수집
- EC2 A상품 001–100완료 기록
- EC2 B상품 101–200완료 기록
- EC2 C상품 201–300완료 기록
작업별 완료 기록
- A기록됨
- B기록됨
- C기록됨
각 EC2가 나눠 수집한 가격을 모아 검증 단계로 보냅니다.
수집한 데이터의 규칙·의미를 확인하고 검수자의 승인을 거칩니다.
START WITH YOUR DATA
필요한 데이터와
주기를 알려주세요.
대상 사이트, 필요한 항목, 수집 주기와 현재의 어려움을 알려주세요. 수집 가능 여부, 검증 기준, 전달 형식과 운영 조건을 검토합니다. 요구사항이 정리되지 않았다면 현재 업무부터 설명해 주셔도 됩니다.