
1. 한 데이터 엔지니어가 AWS Glue 추출, 변환 및 로드(ETL) 파이프라인을 배포하고자 새 계정을 생성했다. 파이프라인 작업을 통해 소스 Amazon S3 버킷에서 원시 데이터를 수집해야 한다. 그런 다음 파이프라인 작업에서, 변환된 데이터를 동일한 계정의 대상 S3 버킷에 작성한다. 데이터 엔지니어는 AWS Glue가 소스 S3 버킷과 대상 S3 버킷에 액세스할 수 있는 권한이 포함된 IAM 정책을 작성했다. ETL 파이프라인을 실행하려면 데이터 엔지니어가 IAM 정책의 권한을 AWS Glue에 부여해야 한다. 다음 중 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
2. 전자 상거래 회사가 AWS에서 여러 애플리케이션을 실행한다. 이 회사는 중앙 집중식 스트리밍 로그 수집 솔루션을 설계하려고 한다. 솔루션을 사용해 로그 파일을 Apache Parquet 형식으로 변환할 수 있어야 한다. 그런 다음 솔루션으로 Amazon S3에 로그 파일을 저장할 수 있어야 한다. 생성되는 로그 파일의 수는 하루 중에 계속 달라진다. 데이터 엔지니어는 로그 파일을 거의 실시간으로 전달하도록 지원하는 솔루션을 구성해야 한다. 다음 중 최소한의 운영 오버헤드로 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
3. 한 전자 상거래 회사가 AWS에서 애플리케이션을 실행하고 있다. 이 애플리케이션은 Amazon Redshift의 테이블에서 최신 데이터를 얻고 있다. 1년 이상 된 데이터는 Amazon S3에서 액세스할 수 있다. 최근 SQL로 작성된 새로운 보고서가 있다. 보고서를 비교하려면 올해 매출 테이블의 일부 열과 전년도 매출 데이터가 포함된 테이블에서 동일한 열을 살펴봐야 한다. 보고서 실행 속도가 느리고 성능이 떨어지며 결과를 얻기까지 기다리는 시간이 길다. 데이터 엔지니어가 쿼리를 가속화하려면 백엔드 스토리지를 최적화해야 한다. 다음 중 가장 효과적으로 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
4. 회사에서 데이터를 저장하는 데 Amazon S3 버킷을 활용한다. 이 회사는 새로운 데이터 수명 주기 및 보존 정책을 채택하는 중이다. 정책 정의는 다음과 같다.
- 새로 생성된 데이터는 모두 온라인에서 사용할 수 있어야 하고 경우에 따라 SQL로 분석을 수행할 수 있어야 한다.
- 3년이 지난 데이터는 안전하게 보관하고 규정 준수 평가를 위해 필요할 때 12시간 이내에 사용할 수 있어야 한다.
- 10년 이상 된 데이터는 안전하게 삭제해야 한다.
데이터 엔지니어는 데이터 수명 주기 및 보존 정책에 따라 데이터를 비용 효율적으로 저장할 수 있는 솔루션을 구성해야 한다. 다음 중 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
5. 회사가 AWS Glue를 사용하여 레코드를 처리하는 데이터 파이프라인을 배포했다. 레코드에는 JSON 형식의 이벤트가 포함되며 경우에 따라 base64로 인코딩된 이미지가 포함되기도 한다. AWS Glue 작업은 10개의 데이터 처리 단위(DPU)로 구성된다. 하지만 AWS Glue 작업은 정기적으로 수백 개의 DPU로 확장되며 실행하는 데 시간이 오래 걸릴 수 있다. 데이터 엔지니어는 데이터 파이프라인을 모니터링하여 적절한 DPU 용량을 결정해야 한다. 다음 중 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
6. 회사가 여러 운영 소스에서 Amazon S3 데이터 레이크로 데이터를 수집한다. 그런 다음 회사는 비즈니스 분석팀이 분석할 수 있도록 데이터를 Amazon Redshift에 수집한다. 비즈니스 분석팀은 최근 3개월간의 고객 데이터에만 액세스할 수 있어야 한다. 또한 회사는 일 년에 한 번 전년도 데이터를 자세히 분석하여 나온 결과를 지난 12개월의 전체 결과와 비교한다. 분석 및 비교한 후에는 더 이상 데이터에 액세스할 수 없다. 그러나 규정을 준수하려면 데이터를 12개월 이후에도 보관해야 한다. 다음 중 가장 비용 효율적인 방식으로 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
7. 회사의 데이터가 온프레미스 NFS 파일 공유에 있다. 회사는 AWS로 마이그레이션할 계획이며, 데이터 분석에 데이터가 사용된다. 이 회사는 AWS Lambda 함수를 작성해 데이터를 분석한다. 그리고 Lambda가 액세스하는 파일 시스템에 NFS를 계속 사용하고자 한다. 동시에 실행되는 모든 Lambda 함수 전반에서 데이터가 공유되어야 한다. 다음 중 회사가 이 데이터 마이그레이션에 사용해야 할 솔루션은 무엇인가?
8. 회사는 사용자가 만든 데이터를 분석용으로 수집하는 데 Amazon S3 데이터 레이크를 사용한다. Amazon S3에서 수집 및 저장되는 일부 데이터에는 개인 식별 정보(PII) 가 포함된다. 이 회사는 데이터 엔지니어가 분석을 수행하기 전에 자동화 솔루션을 설계하여 신규 및 기존 데이터에 포함된 PII에서 마스킹되어야 할 데이터를 식별하기를 바란다. 또한 데이터 엔지니어는 식별된 데이터의 개요를 제공해야 한다. 데이터를 마스킹하는 작업은 AWS 계정에 이미 생성된 애플리케이션에서 처리된다. 데이터 엔지니어는 PII를 찾을 때 실시간으로 이 애플리케이션을 호출할 수 있는 솔루션을 설계해야 한다. 다음 중 최소한의 운영 오버헤드로 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
9. AWS에 중앙 집중식 메타데이터 스토리지 솔루션을 배포해야 하는 데이터 엔지니어가 있다. 솔루션은 안정적이고 확장 가능해야 하며, 데이터베이스, 테이블, 열, 행 및 셀 수준에서 세분화된 권한을 제어할 수 있어야 한다. 다음 중 최소한의 운영 오버헤드로 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
데이터 레이크와 데이터 카탈로그를 생성할 수 있도록 AWS Lake Formation을 사용한다. Lake Formation 데이터 필터를 사용하여 액세스를 제어한다.
10. 한 금융 회사가 투자 전략 강화를 위해 기계 학습(ML) 모델을 개발했다. 이 모델에서는 주식, 채권 및 원자재 시장과 관련된 다양한 데이터 소스가 사용된다. 모델은 프로덕션 승인을 받았다. 데이터 엔지니어는 ML 의사결정을 실행하는 데 사용되는 데이터가 정확하고 완전하며 신뢰할 수 있는지를 확인해야 한다. 데이터 엔지니어는 모델 프로덕션 배포를 대비한 데이터 준비를 자동화해야 한다. 다음 중 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
11. 회사가 AWS에서 Amazon Redshift 데이터 웨어하우스를 운영하고 있다. 이 회사는 최근 여러 AWS 서비스에서 지원하는 서비스형 소프트웨어(SaaS) 영업 애플리케이션의 사용을 시작했다. 그리고 보고 목적으로 SaaS 애플리케이션의 일부 데이터를 Amazon Redshift로 전송하고자 한다. 데이터 엔지니어는 SaaS 애플리케이션에서 Amazon Redshift로 데이터를 지속적으로 전송할 수 있는 솔루션을 구성해야 한다. 다음 중 최소한의 운영 오버헤드로 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
12. 한 금융 회사가 Amazon S3 버킷에 지불이 끝난 인보이스를 저장하고 있다. 인보이스가 업로드되면 AWS Lambda 함수에서 Amazon Textract를 사용하여 PDF 데이터를 처리하고 데이터를 Amazon DynamoDB에 보관한다. 현재 Lambda 실행 역할에는 다음의 S3 권한이 있다.
{
"Version": "2012-10-17",
"Statement": [
{
"Sid": "ExampleStmt",
"Action": ["s3:*”],
"Effect": "Allow",
"Resource": ["*"]
}
]
}
이 회사는 보안 모범 사례에 따라 Amazon S3에 역할 권한을 지정하여 수정하고자 한다. 다음 중 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
s3:PutObject: 특정 S3 버킷에 객체를 업로드하는 데 사용s3:GetObject: 특정 S3 버킷에서 객체를 다운로드하는 데 사용s3:DeleteObject: 특정 S3 버킷에서 객체를 삭제하는 데 사용s3:ListBucket: 특정 S3 버킷의 내용을 나열하는 데 사용s3:CopyObject: S3 버킷 내의 객체를 다른 위치로 복사하는 데 사용s3:AbortMultipartUpload: 멀티파트 업로드를 중단하는 데 사용s3:ListMultipartUploadParts: 멀티파트 업로드의 일부를 나열하는 데 사용13. Amazon Kinesis 애플리케이션에서 Kinesis 데이터 스트림의 데이터를 읽으려고 한다. 그런데 읽기 데이터 호출이 거부되며, 다음 오류 메시지가 표시된다: ProvisionedThroughputExceededException. 다음 중 어떤 단계를 조합하여 오류를 해결할 수 있는가? (2개 선택)
ProvisionedThroughputExceededException: Amazon Kinesis 데이터 스트림 내 데이터 읽기 처리량 제한 초과14. Amazon Redshift 클러스터를 운영 중인 회사가 있다. 데이터 엔지니어는 회사가 Amazon Redshift의 별도 테스트 환경에서 분석 자료를 얻을 수 있도록 솔루션을 설계해야 한다. 솔루션은 기본 Redshift 클러스터의 데이터를 사용한다. 두 번째 클러스터는 새로운 테스트 프로세스의 일환으로 2주마다 2시간 동안만 사용될 것으로 예상하고 있다. 다음 중 가장 비용 효율적인 방식으로 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
Redshift Serverless 15. 회사가 Amazon S3 데이터 레이크를 사용 중이다. 이 회사는 Amazon Kinesis Data Streams를 사용하여 데이터 레이크로 데이터를 수집한다. 그리고 AWS Lambda를 사용하여 스트림에서 들어오는 데이터를 읽고 처리한다. 수집되는 데이터의 볼륨이 매우 가변적이어서 예측할 수 없다. 현재 대량의 데이터가 스트림에 게시되는 피크 시간대에는 IteratorAge 지표가 높게 나타난다. 데이터 엔지니어는 Lambda로 Kinesis Data Streams를 읽을 때 성능을 높이는 솔루션을 설계해야 한다. 다음 중 이러한 요구 사항을 충족하는 솔루션은 무엇인가? (3개 선택)
Kinesis 데이터 스트림의 샤드 수를 늘린다.
최적의 성능을 찾고자 다양한 병렬화 인자 설정을 테스트한다.
향상된 팬아웃을 통해 Lambda 함수를 소비자로 등록한다.
Kinesis Data Streams
AWS Lambda는 Kinesis Data Streams에서 레코드를 가져올 수 있음
Kinesis Enhanced Fan Out
Kinesis 작업 - 샤드 추가
Iterator: 데이터 스트림에서 이벤트를 읽기 위한 반복자
IteratorAge: Kinesis 데이터 스트림에서 제공되는 지표로, 데이터가 스트림에서 처리되는 데 걸리는 시간
Kinesis Shard: 스트림의 데이터 처리량을 확장하고 늘리는 데 사용
팬아웃(Fan-out): 데이터를 여러 소비자로 복사하는 것
16. 한 컨설턴트 회사는 클라우드 기반 시간 추적 시스템을 사용하여 직원의 근무 시간을 추적한다. 전 세계에 널리 퍼져있는 이 회사의 직원은 수천 명에 이른다. 시간 추적 시스템에서는 전날의 레코드를 CSV 형식으로 가져오는 REST API를 제공한다. 이 회사는 온프레미스에 크론을 운영하고 있는데, 이 크론은 매일 아침 같은 시간에 Python 프로그램을 실행하도록 예약되어 있다. 이 프로그램은 데이터 레이크 역할을 하는 Amazon S3 버킷에 데이터를 저장한다. 데이터 엔지니어는 동일한 Python 코드와 크론 구성을 재사용하는 AWS 서비스를 갖춘 솔루션을 제공해야 한다. 다음 중 최소한의 운영 오버헤드로 이러한 요구 사항을 충족하는 단계는 무엇인가? (2개 선택)
AWS Lambda 함수에서 Python 코드를 실행한다.
Amazon EventBridge 스케줄러를 사용하여 크론을 예약한다.
AWS Lambda
Amazon EventBridge
17. 한 데이터 엔지니어가 변환할 데이터를 Amazon Simple Queue Service(Amazon SQS) 대기열에 추가하는 애플리케이션을 설계 중이다. 마이크로서비스는 대기열에서 메시지를 수신한다. 데이터 엔지니어는 메시지 지속성이 유지되기를 바란다. 다음 중 어떤 이벤트가 SQS 대기열에서 메시지를 제거할 수 있는가? (3개 선택)
Amazon SQS18. 회사가 Amazon RDS for Microsoft SQL Server 데이터베이스 기반 Amazon EC2 인스턴스에서 클라우드 기반 소프트웨어 애플리케이션을 실행 중이다. 애플리케이션은 데이터베이스의 자격 증명 정보 및 레코드를 수집, 처리 및 저장한다. 회사는 자격 증명 노출 위험을 제거하고자 한다. 다음 중 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
AWS Secrets Manager19. 데이터 엔지니어가 Amazon Elastic Kubernetes Service(Amazon EKS)에서 관리하는 컨테이너의 데이터를 변환하는 애플리케이션을 설계하는 중이다. 컨테이너는 Amazon EC2 노드에서 실행된다. 컨테이너화된 각 애플리케이션은 독립적인 데이터 집합을 변환한 다음 데이터 레이크에 데이터를 저장한다. 데이터를 다른 컨테이너와 공유할 필요는 없다. 데이터 엔지니어는 변환이 완료되기 전에 데이터를 저장할 위치를 정해야 한다. 다음 중 최소한의 지연 시간으로 이러한 요구 사항을 충족하는 솔루션은 무엇인가?
Amazon EKS20. 한 보험 회사에서 차량 보험 데이터를 사용하여 위험 분석 기계 학습(ML) 모델을 구축하고 있다. 데이터에는 개인 식별 정보(PII) 가 포함되어 있으며, ML 모델에서 PII가 사용되면 안 된다. 또한 규정에 따라 AWS Key Management Service(AWS KMS) 키로 데이터를 암호화해야 한다. 데이터 엔지니어는 ML 모델에 사용할 보험 데이터를 전달하는 데 적합한 서비스를 선택해야 한다. 다음 중 가장 비용 효율적인 방식으로 이러한 요구 사항을 충족하는 몇 가지 단계는 무엇인가? (2개 선택)
Amazon S3 서버 암호화AWS Glue DataBrew