For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.
데이터 가변성 기능
Amplitude 아카데미
이벤트 변경 가능성: 데이터 웨어하우스 변경 사항을 Amplitude에 동기화
데이터 웨어하우스의 변경 사항을 Amplitude와 동기화하는 방법을 알아보세요.
시작하기데이터 가변성은 웨어하우스의 UPDATE, 및 DELETE작업을 이미 Amplitude에 저장된 이벤트 데이터에 INSERT적용하므로, 단일 진실 공급원의 수정, 늦게 도착한 행 및 삭제 사항이 분석에 전파됩니다. Mirror Sync는 Snowflake, Databricks, Google BigQuery 및 Amazon S3에서 이러한 작업을 제공합니다.
웨어하우스가 신뢰할 수 있는 단일 소스이고 GDPR 또는 CCPA 삭제, 다시 채우기 수정 사항 또는 늦게 도착한 업데이트와 같이 첫 번째 쓰기 이후 해당 행이 변경되는 경우 Mirror Sync를 설정하십시오. 이벤트가 발생한 후 변경되지 않는 경우 표준 추가 전용 수집을 유지하십시오. 웨어하우스를 연결하지 않고 잘못된 레이블이 지정되었거나 중복된 데이터만 수정해야 하는 경우 대신 변환을 사용하십시오.
지원되는 데이터 소스
데이터 가변성은 다음과 같은 웨어하우스 통합을 통해 제공됩니다.
스노우플레이크
- 변경 데이터 캡처(CDC)를 사용한 미러 동기화 전략
INSERT,UPDATE및DELETE작업을 지원합니다.- 소스 테이블에서 변경 내용 추적을 활성화해야 합니다.
- Snowflake 연동에 대해 자세히 알아보기 →.
데이터브릭스
- CDF(변경 데이터 피드)를 사용한 미러 동기화 전략
INSERT,UPDATE및DELETE작업을 지원합니다.- 델타 테이블에서 변경 데이터 피드를 활성화해야 합니다.
- Databricks 연동에 대해 자세히 알아보기 →.
Google BigQuery(베타)
- BigQuery의
CHANGES()변경 내역과 미러링된 동기화 전략. - Event 데이터 유형에 대해
INSERT,UPDATE, 및DELETE연산을 지원합니다. - 소스 테이블에 대해 변경 내역을 활성화해야 합니다(
enable_change_history = TRUE). - BigQuery 연동에 대해 자세히 알아보기 →.
Amazon S3
- 파일 기반 변이를 위한 미러 동기화 전략
INSERT,UPDATE및DELETE작업을 지원합니다.- 데이터 파일에 구조화된 변이 메타데이터가 필요합니다.
- Amazon S3 연동에 대해 자세히 알아보기 →.
미러 동기화 작동 방식
데이터 가변성을 갖춘 Mirror Sync를 활성화할 경우:
변경 감지: 연동은 기본 변경 추적 기능(Snowflake용 CDC, Databricks용 CDF, BigQuery용 변경 내역 또는 S3용 파일 메타데이터)을 사용하여 웨어
CHANGES()하우스의 데이터 변경을 모니터링합니다.작업 처리: Amplitude는 세 가지 유형의 작업을 처리합니다.
INSERT: Amplitude에 새로운 이벤트를 추가합니다.UPDATE: Amplitude의 기존 이벤트를 수정합니다.DELETE: Amplitude에서 이벤트를 제거합니다.
Amplitude는
user_id,insert_id및event_time의 조합을 기반으로 일치하는 이벤트를 찾습니다. Amplitude가 올바른 이벤트를 식별하고 수정하려면 세 필드 모두 일치해야 합니다.데이터 동기화: 웨어하우스와 Amplitude 대상 구간 일관성을 유지하기 위해 변경 사항이 적용됩니다.
보강 서비스
보강 서비스 비활성화
: 데이터 가변성과 함께 미러 동기화를 사용할 때 Amplitude는 다음을 포함한 보강 서비스를 비활성화합니다.
- ID 확인 및 사용자 병합.
- 속성 및 기여 동기화.
- 위치 확인.
- 택소노미 검증.
보강을 비활성화하면 데이터가 데이터 원천에 존재하는 그대로 유지됩니다.
일반 요구 사항
- 사용자 ID 필요: 모든 이벤트에는 사용자 ID가 포함되어야 합니다. 미러 동기화는 익명 이벤트를 지원하지 않습니다.
- 고유 삽입 ID: 중복을 방지하기 위해 각 이벤트는 고유하고 불변하는 ID를 가져야 합니다
insert_id. - 시간순: 가능한 경우 이벤트를 시간순으로 처리합니다.
이벤트 볼륨 고려 사항
이벤트 볼륨 영향
: 데이터 변형은 이벤트 볼륨에 포함됩니다.
- 웨어하우스 소스(Snowflake, Databricks, BigQuery): 동기화 기간 내에서 동일한 이벤트에 대한 여러 작업은 하나의 이벤트로 간주됩니다.
- 파일 소스(S3): 각 작업은 이벤트 볼륨에 개별적으로 계산됩니다.
사용량을 모니터링하고 이벤트 볼륨을 추가로 늘려야 할 경우 영업팀에 문의하십시오.
데이터 리텐션
- Snowflake:
DATA_RETENTION_TIME_IN_DAYS1 이상이어야 합니다(권장사항: 7일 이상). - Databricks: 변경 데이터 피드 리텐션은 동기화 빈도에 맞춰야 합니다.
- BigQuery: 테이블의 시간 여행 기간은 동기화 빈도(기본값은 7일, 2일에서 7일까지 구성 가능)를 충족해야 합니다.
- S3: 파일은 처리 과정에서 액세스할 수 있는 상태로 유지되어야 합니다.
모범 사례
데이터 가변성을 활성화할 때 다음 모범 사례를 염두에 두십시오.
구현 계획 수립
테스트 프로젝트를 시작하십시오. 프로덕션에 구현하기 전에 변이 논리를 검증하기 위한 전용 테스트 환경을 만듭니다.
멱등성을 위한 설계: 데이터 불일치를 야기하지 않고 안전하게 재시도할 수 있도록 변이 작업을 구축하십시오.
데이터 품질 모니터링: 유효성 검사를 구현하여 변이가 올바르게 적용되는지 확인합니다.
데이터 개인정보 보호 컴플라이언스
개인정보 보호 컴플라이언스를 위해 데이터 변경성을 사용하는 경우:
먼저 데이터 흐름을 중지하십시오: 사용자 데이터를 삭제하기 전에 해당 사용자에 대한 새로운 데이터를 Amplitude로 전송하지 않아야 합니다.
사용자 개인정보 보호 API 사용: 사용자를 완전히 삭제하려면 웨어하우스 삭제와 함께 사용자 개인정보 보호 API를 사용하십시오.
삭제 확인: 삭제된 데이터가 더 이상 분석에 표시되지 않는지 확인합니다.
성능 최적화
- 배치 작업: 가능한 경우 관련 변이를 함께 그룹화합니다.
- 동기화 빈도 최적화: 데이터 신선성 요구와 처리 오버헤드의 균형을 맞춥니다.
- 리소스 사용량 모니터링: 변경 사항 추적과 관련된 웨어하우스 컴퓨팅 비용을 추적합니다.
데이터 가변성으로 마이그레이션
표준 수집 전략에서 미러 동기화로 마이그레이션하려는 경우 다음 단계를 따르십시오.
권장되는 마이그레이션 단계
차단 전략 생성:
- 시간 필터를 사용하여 기존 연결을 수정합니다(예:
WHERE time < {cutOffDate}). - 마감일을 에포크 날짜 이후 밀리초 단위로 내일로 설정합니다.
- 시간 필터를 사용하여 기존 연결을 수정합니다(예:
차단 대기: 차단 날짜가 지나도록 허용하고 이전 연결을 통해 새로운 데이터가 흐르지 않는지 확인합니다.
새 미러 동기화 소스 생성:
- 보완 필터를 사용하여 새 소스를 구성합니다(예:
WHERE time >= {cutOffDate}). - 원하는 변환 설정으로 미러 동기화를 활성화합니다.
- 보완 필터를 사용하여 새 소스를 구성합니다(예:
정리: 새 연결이 제대로 작동하는지 확인한 후 이전 소스 연결을 제거하십시오.
일반적인 문제
이벤트가 업데이트되지 않음
- 소스 테이블에서 변경 내용 추적이 활성화되어 있는지 확인합니다.
- 이벤트에 필수 사용자 ID가 포함되어 있는지 확인하십시오.
- 동기화 빈도 설정을 확인합니다.
누락된 삭제 내용
- DELETE 작업이 소스에서 올바르게 구성되었는지 확인하십시오.
- 삭제된 이벤트에 유효한 사용자 ID가 있는지 확인하십시오.
- 변경 사항 리텐션 기간이 만료되지 않았는지 확인하십시오.
데이터 불일관성
- 변이 작업 순서를 검토합니다.
- Amplitude가 예상대로 보강 서비스를 비활성화했는지 확인합니다.
- 웨어하우스 변경과 동기화 실행 대상 구간의 시간 문제를 확인하십시오.
이 내용이 도움이 되었나요?