<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>hey_min_37.log</title>
        <link>https://velog.io/</link>
        <description>It's a, it's the Pleasure Shop</description>
        <lastBuildDate>Fri, 17 Jan 2025 13:07:17 GMT</lastBuildDate>
        <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
        <generator>https://github.com/jpmonette/feed</generator>
        <image>
            <title>hey_min_37.log</title>
            <url>https://velog.velcdn.com/images/hey_min_37/profile/0611ea3f-9236-429c-a76c-49887eac3b94/social_profile.jpeg</url>
            <link>https://velog.io/</link>
        </image>
        <copyright>Copyright (C) 2019. hey_min_37.log. All rights reserved.</copyright>
        <atom:link href="https://v2.velog.io/rss/hey_min_37" rel="self" type="application/rss+xml"/>
        <item>
            <title><![CDATA[[WIL] 1월 셋째주]]></title>
            <link>https://velog.io/@hey_min_37/WIL-1%EC%9B%94-%EC%85%8B%EC%A7%B8%EC%A3%BC</link>
            <guid>https://velog.io/@hey_min_37/WIL-1%EC%9B%94-%EC%85%8B%EC%A7%B8%EC%A3%BC</guid>
            <pubDate>Fri, 17 Jan 2025 13:07:17 GMT</pubDate>
            <description><![CDATA[<h1 id="이번주-한-일">이번주 한 일</h1>
<ul>
<li>프로덕트 데이터 사이언스 강의</li>
<li>감정분석(리뷰 테이블 중심으로)</li>
<li>긍정/부정 키워드 워드 클라우드 그래프</li>
<li>긍정/부정 키워드 네트워크 그래프</li>
<li>리뷰 클러스터링(실패)<h1 id="다음주-할-일">다음주 할 일</h1>
</li>
<li>물류 관련 방향 정리</li>
<li>사업계획서 작성</li>
</ul>
<h1 id="이번주-소회">이번주 소회</h1>
<p>방향성이 너무 안 잡혀서 힘들다 괴롭다~~</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[최종 프로젝트 정리]]></title>
            <link>https://velog.io/@hey_min_37/%EC%B5%9C%EC%A2%85-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-%EC%A0%95%EB%A6%AC</link>
            <guid>https://velog.io/@hey_min_37/%EC%B5%9C%EC%A2%85-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-%EC%A0%95%EB%A6%AC</guid>
            <pubDate>Fri, 17 Jan 2025 05:09:41 GMT</pubDate>
            <description><![CDATA[<p>🔍 현재 진행 상황 정리
텍스트 마이닝 분석</p>
<p>워드클라우드, 네트워크 그래프를 활용하여 텍스트 분석을 수행했음.
결과적으로, &quot;배송&quot;과 관련된 단어가 주요하게 나타났으며, 기존 기대했던 것보다 유의미한 인사이트를 도출하기 어려웠음.
리뷰 기반 클러스터링</p>
<p>리뷰 텍스트만으로 K-Means 등 클러스터링을 적용했지만, 의미 있는 그룹이 나오지 않음.
리뷰 자체에 결측치가 많고, 단순한 텍스트 분석만으로는 고객을 효과적으로 그룹화하기 어려울 가능성이 있음.
추가적으로 활용할 수 있는 변수</p>
<p>고객 특성: customer_state, customer_city
제품 특성: product_category_name
리뷰 특성: review_score, cleaned_reviews (결측치 존재)
구매 특성: order_purchase_timestamp, price, payment_value
🤔 클러스터링을 어떻게 진행해야 할까?
💡 텍스트만이 아니라 여러 컬럼을 종합적으로 고려하는 것이 중요함.</p>
<p>🚀 1️⃣ 리뷰 텍스트만으로 클러스터링 진행 후, 추가 분석
✅ 리뷰가 있는 데이터만을 활용해서 클러스터링을 수행한 뒤, 해당 결과를 다른 데이터와 결합하여 추가 분석</p>
<p>🔹 프로세스</p>
<p>cleaned_reviews 텍스트 데이터를 TF-IDF 벡터화
K-Means 또는 DBSCAN 등을 사용하여 리뷰 기반 클러스터링 수행
클러스터 결과를 기존 orders_with_sellers 데이터에 추가하여 리뷰를 기반으로 고객을 분류
🔹 장점</p>
<p>리뷰 내용에서 숨겨진 고객 패턴을 파악할 수 있음.
리뷰 데이터를 활용하는 모델을 구축할 수 있음.
리뷰 중심의 고객 유형 분류가 가능해짐.
🔹 단점</p>
<p>리뷰 자체가 없는 데이터가 많으면 활용성이 떨어짐.
텍스트만으로 유의미한 클러스터가 나오지 않을 수도 있음.
🚀 2️⃣ 리뷰를 포함한 여러 변수 기반 클러스터링
✅ 리뷰 유무와 상관없이 고객, 제품, 결제 등의 변수를 포함하여 클러스터링 수행</p>
<p>🔹 프로세스</p>
<p>customer_state, customer_city, product_category_name, review_score, price, payment_value 등을 수치형으로 변환
범주형 변수(state, city, category) → One-Hot Encoding
연속형 변수(price, payment_value) → 표준화
리뷰 데이터(cleaned_reviews → TF-IDF + PCA 차원 축소)
K-Means, DBSCAN, GMM 등의 클러스터링 알고리즘 적용
클러스터별 고객 특성을 분석하여 유사 고객 그룹화
🔹 장점</p>
<p>리뷰가 없는 데이터도 활용할 수 있음.
가격, 결제 방식, 구매 지역 등 고객 행동 패턴까지 고려 가능.
보다 실질적인 비즈니스 인사이트를 얻을 가능성이 높음.
🔹 단점</p>
<p>데이터 차원이 커지므로 차원 축소(PCA 등)가 필요할 수도 있음.
customer_state, product_category_name 등의 범주형 변수를 잘 다뤄야 함.
🔑 결론: 어떤 방법이 더 적절할까?
✔️ 리뷰가 있는 데이터만을 활용하는 경우, 리뷰 자체의 클러스터링을 통해 유사한 고객군을 도출할 수 있지만, 결측치가 많아 활용할 수 있는 고객이 제한적일 가능성이 큼.</p>
<p>✔️ 리뷰뿐만 아니라 고객의 구매 패턴까지 포함한 클러스터링이 보다 의미 있는 결과를 도출할 가능성이 큼.
✅ customer_state, city, category, price, payment_value, review_score 등의 변수와 <strong>리뷰 텍스트에서 추출한 특징(TF-IDF + PCA 축소)</strong>을 함께 사용하여 클러스터링하는 것이 더 적절할 가능성이 높음.</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[WIL] 1월 둘째주]]></title>
            <link>https://velog.io/@hey_min_37/WIL-12%EC%9B%94-%EB%91%98%EC%A7%B8%EC%A3%BC-slp1lec9</link>
            <guid>https://velog.io/@hey_min_37/WIL-12%EC%9B%94-%EB%91%98%EC%A7%B8%EC%A3%BC-slp1lec9</guid>
            <pubDate>Fri, 10 Jan 2025 14:56:30 GMT</pubDate>
            <description><![CDATA[<h2 id="이번주-한-일">이번주 한 일</h2>
<ul>
<li>API 특강</li>
<li>자연어 특강</li>
<li>프로덕트 데이터 사이언스</li>
<li>프로젝트 기획서 작성</li>
<li>프로젝트 EDA<h2 id="다음주-할-일">다음주 할 일</h2>
</li>
<li>프로젝트 기획서 피드백 정리 및 반영</li>
<li>프로젝트 EDA(중간) 보고서 제출</li>
<li>프로젝트 EDA(중간) 보고서 피드백 정리 및 반영</li>
<li>EDA 마무리</li>
<li>사업 계획서<h2 id="이번주-소회">이번주 소회</h2>
</li>
<li>EDA가 이렇게 힘든거였나... </li>
<li>너무 많은 걸 하려고 하지 말자. 집중 잘 하자.</li>
<li>담주도 화이팅!</li>
</ul>
]]></description>
        </item>
        <item>
            <title><![CDATA[[챌린지]프로덕트 데이터사이언스②]]></title>
            <link>https://velog.io/@hey_min_37/%EC%B1%8C%EB%A6%B0%EC%A7%80%ED%94%84%EB%A1%9C%EB%8D%95%ED%8A%B8-%EB%8D%B0%EC%9D%B4%ED%84%B0%EC%82%AC%EC%9D%B4%EC%96%B8%EC%8A%A4-rp84zbsb</link>
            <guid>https://velog.io/@hey_min_37/%EC%B1%8C%EB%A6%B0%EC%A7%80%ED%94%84%EB%A1%9C%EB%8D%95%ED%8A%B8-%EB%8D%B0%EC%9D%B4%ED%84%B0%EC%82%AC%EC%9D%B4%EC%96%B8%EC%8A%A4-rp84zbsb</guid>
            <pubDate>Fri, 10 Jan 2025 14:46:55 GMT</pubDate>
            <description><![CDATA[<h2 id="프로덕트-센스와-기회-규모-추정-방법론">프로덕트 센스와 기회 규모 추정 방법론</h2>
<p>이번 챌린지는 데이터 기반으로 프로덕트 개선 방향을 설정하고 비즈니스 임팩트를 창출하기 위한 프레임워크를 배웠습니다.</p>
<h3 id="1-프로덕트-센스product-sense란">1. 프로덕트 센스(Product Sense)란?</h3>
<p>정의: 사용자의 니즈를 이해하고, 비즈니스 목표 달성을 위한 제품 전략을 수립하는 능력.
중요성:
사용자 중심 접근: 고객 문제를 효과적으로 해결.
데이터 기반 의사결정: 제품 개선 방향을 명확히 함.
비즈니스 임팩트: 핵심 목표(North Star Metric) 달성을 돕는 전략 제안.</p>
<h3 id="2-기회-규모-추정-3단계-프레임워크">2. 기회 규모 추정 3단계 프레임워크</h3>
<p><strong>1단계: 동기(Motivation) 이해</strong></p>
<p>고객과 회사가 얻을 수 있는 이점 파악.
예: 정기 결제 도입 시 고객 편의성 증대, 거래 규모 상승.</p>
<p><strong>2단계: 기회 규모 추정</strong></p>
<p>기존 데이터 분석으로 거래 패턴 추출 및 기회 규모 산출.
기능 도입 후 예상되는 채택률 기반 효과 추정.
민감도 분석: 최악과 최상의 시나리오 고려.</p>
<p><strong>3단계: 비용과 리스크 평가</strong>
개발 비용과 리소스 소요량 평가.
다른 프로젝트와 비교하여 우선순위 결정.
<strong>실무 적용 사례</strong></p>
<ul>
<li>카카오톡 선물하기
사용자의 플랫폼 내 활동성과 신규 사용자 유입 증가.</li>
<li>네이버 쇼핑 라이브
실시간 소통을 통한 구매 전환율 상승.</li>
</ul>
<h2 id="정리">정리</h2>
<p>프로덕트 센스는 사용자의 니즈와 비즈니스 목표를 결합하는 중요한 능력.
기회 규모 추정 프레임워크는 제품 개발 우선순위를 설정하는 데 필수적인 도구.
데이터를 기반으로 한 정량적 분석과 정성적 데이터 보완이 성공의 핵심.</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[특강]자연어 처리①]]></title>
            <link>https://velog.io/@hey_min_37/%ED%8A%B9%EA%B0%95%EC%9E%90%EC%97%B0%EC%96%B4-%EC%B2%98%EB%A6%AC</link>
            <guid>https://velog.io/@hey_min_37/%ED%8A%B9%EA%B0%95%EC%9E%90%EC%97%B0%EC%96%B4-%EC%B2%98%EB%A6%AC</guid>
            <pubDate>Thu, 09 Jan 2025 13:20:00 GMT</pubDate>
            <description><![CDATA[<p>자연어 처리는 현대 데이터 분석의 필수적인 부분으로 자리 잡고 있습니다. &quot;자연어 처리 특강&quot;의 1회차 내용을 바탕으로 텍스트 데이터 분석, 임베딩, 전처리에 대해 정리해 보았습니다.</p>
<h2 id="🌟-학습-목표">🌟 학습 목표</h2>
<ul>
<li>텍스트 데이터 분석의 기본 원리 이해</li>
<li>분석을 위한 전처리 단계 학습</li>
<li>코드를 통한 실습으로 텍스트 데이터 전처리 및 임베딩 수행</li>
</ul>
<h2 id="📌-텍스트-데이터-분석의-원리">📌 텍스트 데이터 분석의 원리</h2>
<h3 id="텍스트-데이터의-특징">텍스트 데이터의 특징</h3>
<p><strong>비정형 데이터</strong>: 구조화된 데이터와 달리, 텍스트 데이터는 비정형적인 특성을 가집니다.
<strong>데이터 전처리의 필요성</strong>: 비정형 데이터를 분석 가능한 형태로 변환하는 작업이 필수적입니다.
<strong>컴퓨팅 자원</strong>: 텍스트 데이터는 용량이 크고, 처리에 많은 자원을 필요로 합니다.
<strong>텍스트 데이터 임베딩</strong>: 텍스트를 기계가 이해할 수 있도록 수치 데이터(벡터)로 변환하는 과정입니다.</p>
<h3 id="대표적인-임베딩-방법">대표적인 임베딩 방법</h3>
<p><strong>One Hot Encoding</strong>
단어를 차원으로 정의하며, 단어의 존재 유무를 이진값으로 표현.
<strong>Term Frequency (TF)</strong>
단어 빈도를 수치화하여 표현.
<strong>TF-IDF</strong>
자주 등장하는 단어의 중요도를 낮추는 가중치 기법.
<strong>Word Embedding</strong>
단어 간 관계를 반영하여 벡터화. 대표적인 방법으로 Word2Vec이 있음.
<strong>LLM 기반 임베딩</strong>
ChatGPT와 같은 대형 언어 모델을 활용하여 고차원 벡터를 생성.</p>
<h2 id="📋-텍스트-데이터-전처리">📋 텍스트 데이터 전처리</h2>
<p><strong>문장 분리</strong>: 긴 텍스트를 문장 단위로 분리해 분석.
<strong>불필요한 문자 제거</strong>: 특수문자, 반복되는 글자 등 제거.
<strong>토큰화(Tokenization)</strong>: 텍스트를 의미 있는 단위로 쪼갬. (예: 형태소 분석)
<strong>불용어 제거(Stopword)</strong>: 분석에 불필요한 단어를 제거해 데이터 품질을 높임.</p>
<h2 id="🙈소회">🙈소회</h2>
<p>자연어 처리의 기초를 다지기 위한 첫 단계로 텍스트 데이터를 어떻게 전처리 할지에 대해 간단히 알아보는 시간을 가졌습니다. 어렵지만 열심히 들으면 분명 큰 도움이 될 것 같고, 흥미가 많이 생겼습니다. 최종 프로젝트에도 적용할 수 있을 것 같아 기대됩니다.</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[챌린지]프로덕트 데이터사이언스]]></title>
            <link>https://velog.io/@hey_min_37/%EC%B1%8C%EB%A6%B0%EC%A7%80%ED%94%84%EB%A1%9C%EB%8D%95%ED%8A%B8-%EB%8D%B0%EC%9D%B4%ED%84%B0%EC%82%AC%EC%9D%B4%EC%96%B8%EC%8A%A4</link>
            <guid>https://velog.io/@hey_min_37/%EC%B1%8C%EB%A6%B0%EC%A7%80%ED%94%84%EB%A1%9C%EB%8D%95%ED%8A%B8-%EB%8D%B0%EC%9D%B4%ED%84%B0%EC%82%AC%EC%9D%B4%EC%96%B8%EC%8A%A4</guid>
            <pubDate>Wed, 08 Jan 2025 10:31:05 GMT</pubDate>
            <description><![CDATA[<h1 id="product-data-science란-무엇인가">Product Data Science란 무엇인가?</h1>
<p>Product Data Science는 데이터를 기반으로 제품 및 서비스의 의사결정을 지원하는 직무입니다.
주요 목표는 제품 개선, 성장 전략 수립, 사용자 경험 최적화입니다.</p>
<h2 id="1-product-data-science의-주요-역할">1. Product Data Science의 주요 역할</h2>
<p><strong>기회 규모 추정 (Opportunity Sizing)</strong>
특정 기능이나 시장 진출이 가져올 가치와 영향을 수치화
→ 데이터를 통해 우선순위 결정</p>
<p><strong>지표 설계 (Metrics Design)</strong>
성과를 측정하고 관리하기 위한 핵심 지표 설계</p>
<p>North Star Metric: 최종적인 성공 지표 (예: &#39;총 스트리밍 시간&#39;)
Guardrail Metrics: 부정적 영향을 방지하기 위한 보조 지표 (예: 사용자 만족도)
Input Metrics: 목표 달성에 기여하는 행동 지표 (예: 신규 사용자 등록 수)
메트릭 변동 딥다이브 (Metric Deep Dive)
주요 제품 지표 변동 원인을 분석하여 문제를 해결</p>
<p><strong>A/B 테스트 설계 및 분석</strong>
실험 설계 및 결과 분석을 통해 데이터 기반 의사결정</p>
<h2 id="2-data-analyst-및-data-scientist와의-차이">2. Data Analyst 및 Data Scientist와의 차이</h2>
<table>
<thead>
<tr>
<th>역할</th>
<th>Data Analyst</th>
<th>Data Scientist</th>
<th>Product Data Scientist</th>
</tr>
</thead>
<tbody><tr>
<td><strong>초점</strong></td>
<td>데이터 시각화, 보고서 작성</td>
<td>머신러닝 모델 개발 및 연구</td>
<td>제품 데이터 분석 및 최적화</td>
</tr>
<tr>
<td><strong>분석 대상</strong></td>
<td>과거 데이터</td>
<td>빅데이터, 모델링</td>
<td>실험 데이터, 제품 메트릭</td>
</tr>
<tr>
<td><strong>협업 팀</strong></td>
<td>경영진 및 주요 의사결정권자</td>
<td>엔지니어링 팀</td>
<td>제품 팀, 비즈니스 팀</td>
</tr>
</tbody></table>
<h2 id="3-product-data-science가-중요한-이유">3. Product Data Science가 중요한 이유</h2>
<ul>
<li>데이터에 기반한 정확한 의사결정 지원</li>
<li>비즈니스 성과와 사용자 경험의 균형 유지</li>
<li>회사의 성장 전략과 긴밀히 연결</li>
</ul>
]]></description>
        </item>
        <item>
            <title><![CDATA[최종 프로젝트 ①]]></title>
            <link>https://velog.io/@hey_min_37/%EC%B5%9C%EC%A2%85-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-1%EC%9D%BC%EC%B0%A8</link>
            <guid>https://velog.io/@hey_min_37/%EC%B5%9C%EC%A2%85-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-1%EC%9D%BC%EC%B0%A8</guid>
            <pubDate>Tue, 07 Jan 2025 12:53:33 GMT</pubDate>
            <description><![CDATA[<h2 id="1-프로젝트-진행">1. 프로젝트 진행</h2>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/93ff55b8-33ae-4665-8d21-d5dce70ad0b8/image.png" alt=""></p>
<p>구글 드라이브 공유 폴더를 활용해 프로젝트를 진행하기로 결정했다. 위처럼 데이터 수집 링크를 적재하기도 하고, 회의록, 진행사항, 코랩을 이용한 코드 공유 등을 진행할 수 있도록 세팅을 했다.</p>
<h2 id="2-데이터-선택">2. 데이터 선택</h2>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/4eadac5d-747c-4e67-804b-e027afa76b8b/image.png" alt=""></p>
<p>데이터는 여러 인사이트를 도출 해 낼 수 있을 거라고 예상한 olist데이터를 선택했다. </p>
<h2 id="3-마인드-맵">3. 마인드 맵</h2>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/74ed89d7-8260-474b-87c1-bcbbf705e9ee/image.png" alt=""></p>
<p>하루동안 간단히 데이터를 살펴보고 각자의 생각을 마인드 맵으로 정리해서 이야기 하는 시간을 가졌다. 툴은 피그마의 피그잼을 이용했다.</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[WIL] 12월 셋째주]]></title>
            <link>https://velog.io/@hey_min_37/WIL-12%EC%9B%94-%EC%85%8B%EC%A7%B8%EC%A3%BC</link>
            <guid>https://velog.io/@hey_min_37/WIL-12%EC%9B%94-%EC%85%8B%EC%A7%B8%EC%A3%BC</guid>
            <pubDate>Fri, 20 Dec 2024 14:29:46 GMT</pubDate>
            <description><![CDATA[<h2 id="이번-주-til">이번 주 TIL</h2>
<p><a href="https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-1%EC%9D%BC%EC%B0%A8">실전 프로젝트 1일차</a>
<a href="https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-2%EC%9D%BC%EC%B0%A8">실전 프로젝트 2일차</a>
<a href="https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-3%EC%9D%BC%EC%B0%A8">실전 프로젝트 3일차</a>
<a href="https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-4%EC%9D%BC%EC%B0%A8">실전 프로젝트 4일차</a></p>
<h2 id="이번-주-소회">이번 주 소회</h2>
<ul>
<li>열심히 하는 것도 좋지만 건강 잘 챙기면서 하자</li>
<li>헷갈릴 수 있지만 확신을 가지면서 하기</li>
<li>지금까지 해왔던거처럼 팀원들과 의지하면서 대화를 통해 더 많은 방향으로 결정하기</li>
</ul>
]]></description>
        </item>
        <item>
            <title><![CDATA[[실전 프로젝트] 4일차]]></title>
            <link>https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-4%EC%9D%BC%EC%B0%A8</link>
            <guid>https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-4%EC%9D%BC%EC%B0%A8</guid>
            <pubDate>Fri, 20 Dec 2024 14:22:04 GMT</pubDate>
            <description><![CDATA[<h2 id="1-최종-백그라운드-디자인">1. 최종 백그라운드 디자인</h2>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/9b6c6fd3-7336-4355-8caa-02fea0faa975/image.png" alt=""></p>
<p>대시보드가 총 4개로 구성되도록 계획을 짯기 때문에 총 네 가지 색상의 백그라운드를 만들었다. </p>
<ol>
<li>Overview : 주요 KPI 지표를 볼 수 있는 Summary 대시보드</li>
<li>Country : 나라, os, 고객 세그먼트를 볼 수 있는 고객 정보 중심 대시보드</li>
<li>Funnel : 주요 지표의 흐름을 알 수 있는 funnel 대시보드</li>
<li>Trend : 광고의 트렌드를 반영하기 위해 최신 트렌드를 실시간으로 반영</li>
</ol>
<hr>
<h2 id="2-튜터님-qa">2. 튜터님 Q&amp;A</h2>
<ul>
<li><p>퍼널 차트 + 생키 차트는 빼지 말고 대시보드를 하나 추가하기 -&gt; 퍼널 중심으로</p>
</li>
<li><p>씽키차트 해석: 어떤 것과도 상관없이 균등하게 분배된다! 그냥 보이는대로 설명하기</p>
</li>
<li><p>대시보드로 현황 파악 + 보고 둘 다 하는 기업도 있음</p>
</li>
<li><p>PPT : 과정을 설명하는 것은 필요할 듯 + 인사이트로 보여주고자 하는 것. 포트폴리오 용도로는 문제정의부터 결과까지의 과정이 중요!!!</p>
</li>
</ul>
<hr>
<h2 id="3-ppt-초안">3. PPT 초안</h2>
<h3 id="목차">&lt;목차&gt;</h3>
<h4 id="0---팀-소개">0.   팀 소개</h4>
<h4 id="1-문제-정의">1. 문제 정의</h4>
<p>a. 신설된 데이터 분석부서
b. 띠용띠용!!!
c. 유관부서가 한눈에 확인 가능한 대시보드를 구성하자! -&gt; 오케이</p>
<h4 id="2-eda">2. EDA</h4>
<p>a. 결측치 X
b. 이상치 O -&gt; 마케팅에서는 제거 안함
c. 상관관계 히트맵?
d. 전반적인 지표 설명</p>
<h4 id="3-대시보드-구상">3. 대시보드 구상</h4>
<ol>
<li>각 시트별 해당 지표 선정 이유 및 목적</li>
<li>해석?</li>
<li>페이지별 컨셉
a. 페이지
b. 페이지
c.  페이지
3-1 페이지 (어쩔 수 없음)
페이지 내용 설명
1페이지
2페이지
3페이지</li>
</ol>
<p>3.인사이트</p>
<ul>
<li>페이지 끝나면 시간 남는 사람이 대시보드 뒤져보기 
액션아이템 (Objective별 액션)
a.  Awareness
b. Engagement
c. Conversion</li>
</ul>
<hr>
<h4 id="⚾소회">⚾소회</h4>
<p>계속 정리하면서 하고 있는데 회의만 하면 원점으로 돌아가는 것 같다. 일단 지금 할 수 있는 것 해야하는 걸 하자! 내일까지 PPT초안 바탕으로 PPT디자인 틀 다 잡기.</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[실전 프로젝트] 3일차]]></title>
            <link>https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-3%EC%9D%BC%EC%B0%A8</link>
            <guid>https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-3%EC%9D%BC%EC%B0%A8</guid>
            <pubDate>Thu, 19 Dec 2024 14:10:16 GMT</pubDate>
            <description><![CDATA[<h2 id="1-로고-제작">1. 로고 제작</h2>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/6c117598-9cac-4ced-aed4-02c0f65dc94a/image.png" alt=""></p>
<h2 id="2-버튼-아이콘-제작">2. 버튼 아이콘 제작</h2>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/ec0a11ac-5a76-42bf-9072-614cd7b62024/image.png" alt=""></p>
<h2 id="3-버튼-필터-대시보드-적용">3. 버튼 필터 대시보드 적용</h2>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/50d64b69-f6d2-44a2-a497-0596f6efeb67/image.png" alt=""></p>
<h2 id="4-소회">4. 소회</h2>
<p>📝오늘 대시보드에 들어갈 전체적인 버튼을 만들었다. 그리고 데이터를 바탕으로 설정한 회사에 대한 로고도 만들었다. 내일은 대시보드에 디자인적으로 적용하고 1번째 대시보드를 완성하고자 한다.</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[실전 프로젝트] 2일차]]></title>
            <link>https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-2%EC%9D%BC%EC%B0%A8</link>
            <guid>https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-2%EC%9D%BC%EC%B0%A8</guid>
            <pubDate>Wed, 18 Dec 2024 14:37:05 GMT</pubDate>
            <description><![CDATA[<h2 id="1-대시보드-구성">1. 대시보드 구성</h2>
<h3 id="주요-kpi-지표">주요 KPI 지표</h3>
<p><strong>예시 이미지)</strong>
<img src="https://velog.velcdn.com/images/hey_min_37/post/ddbb75a0-218d-408a-8724-67d6d5ebd349/image.png" alt=""></p>
<ul>
<li>총 매출</li>
<li><em>필요한 열*</em>
Revenue : 매출</li>
<li>CVR : 클릭 수 대비 전환율</li>
<li><em>필요한 열*</em> 
Conversions: 전환 수
Clicks: 클릭 수</li>
</ul>
<pre><code>CVR = (Conversions / Clicks) × 100</code></pre><ul>
<li><p>CTR :  노출 수 대비 클릭률</p>
</li>
<li><p><em>필요한 열*</em> 
Clicks: 클릭 수
Impressions: 노출 수</p>
<pre><code>CTR = (Clicks / Impressions) × 100</code></pre></li>
<li><p>ROI : 투자 대비 수익률</p>
</li>
<li><p><em>필요한 열*</em>
Revenue: 매출
Cost: 비용</p>
<pre><code>ROI = ((Revenue - Cost) / Cost) × 100</code></pre></li>
<li><p>ROAS : 광고비 대비 매출</p>
</li>
<li><p><em>필요한 열*</em>
Revenue: 매출
Cost: 비용</p>
<pre><code>ROAS = (Revenue / Cost) × 100</code></pre></li>
<li><p>AOV : 평균 주문 금액</p>
</li>
<li><p><em>필요한 열*</em>
Revenue: 매출
Conversions: 전환 수</p>
<pre><code>AOV = Revenue / Conversions</code></pre></li>
</ul>
<h3 id="주요-그래프">주요 그래프</h3>
<p><strong>고객 접속 및 유입 현황</strong>
(타임라인 차트 / 날짜, 클릭수)</p>
<p><strong>참여도(고객 연령대 세그먼트)</strong>
(도넛 차트/ Engagement RATE)
<strong>예시 이미지)</strong>
<img src="https://velog.velcdn.com/images/hey_min_37/post/475d0147-8d79-4fb4-ae9e-94bd709b03da/image.png" alt=""></p>
<p><strong>전환 단계 별 전환율</strong>
(퍼널차트)
각 퍼널 사이에 CTR , CVR 등 제시
<strong>예시 이미지)</strong>
<img src="https://velog.velcdn.com/images/hey_min_37/post/f5bafb97-81b4-47e3-94e5-39d5f37915ef/image.png" alt=""></p>
<p><strong>국가별 매출 / 노출 수</strong>
(지도 / REVENUE, IMPRESSIONS 활용)
<strong>예시 이미지)</strong>
<img src="https://velog.velcdn.com/images/hey_min_37/post/f01c3a17-3702-4d26-8f34-a8cc9e27ff41/image.png" alt=""></p>
<p><strong>📝주요 그래프는 앞으로 충분히 구성이 달라질 수 있음</strong></p>
<h2 id="2-대시보드-구성-이미지">2. 대시보드 구성 이미지</h2>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/0787981c-6857-4810-9d1d-76d3df6598e1/image.png" alt=""></p>
<p><strong>📝피그마로 대시보드 밑그림을 그려보았다. 이걸 바탕으로 태블로에서 다양한 그래프를 그려보고 배치하는 연습으로 다음 단계를 설정했다.</strong></p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[실전 프로젝트] 1일차]]></title>
            <link>https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-1%EC%9D%BC%EC%B0%A8</link>
            <guid>https://velog.io/@hey_min_37/%EC%8B%A4%EC%A0%84-%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8-1%EC%9D%BC%EC%B0%A8</guid>
            <pubDate>Tue, 17 Dec 2024 13:08:17 GMT</pubDate>
            <description><![CDATA[<h2 id="컬럼-분석">컬럼 분석</h2>
<table>
<thead>
<tr>
<th><strong>컬럼</strong></th>
<th><strong>설명</strong></th>
<th><strong>예시</strong></th>
</tr>
</thead>
<tbody><tr>
<td>Activity Date</td>
<td>캠페인을 실행한 날짜</td>
<td>2019-03-31</td>
</tr>
<tr>
<td>country</td>
<td>국가</td>
<td>CN</td>
</tr>
<tr>
<td>os</td>
<td>OS</td>
<td>iOS</td>
</tr>
<tr>
<td>Activity Type</td>
<td>캠페인 유형</td>
<td>Social Media</td>
</tr>
<tr>
<td>Campaign ID</td>
<td>캠페인 ID</td>
<td>5724</td>
</tr>
<tr>
<td>Campaign Name</td>
<td>캠페인명</td>
<td>Black Friday</td>
</tr>
<tr>
<td>Campaign Objective</td>
<td>캠페인 목표</td>
<td>Conversion</td>
</tr>
<tr>
<td>Channel</td>
<td>실행 채널</td>
<td>Facebook</td>
</tr>
<tr>
<td>Conversion Funnel Stage</td>
<td>전환 퍼널 단계</td>
<td>Decision</td>
</tr>
<tr>
<td>Source</td>
<td>캠페인 전달 수단</td>
<td>Paid</td>
</tr>
<tr>
<td>Target Audience</td>
<td>캠페인 전달 타겟</td>
<td>45-54</td>
</tr>
<tr>
<td>Visibility</td>
<td>캠페인 노출 범위</td>
<td>6201</td>
</tr>
<tr>
<td>Campaign Duration</td>
<td>캠페인 기간</td>
<td>21</td>
</tr>
<tr>
<td>Clicks</td>
<td>클릭수</td>
<td>695</td>
</tr>
<tr>
<td>Conversion Rate</td>
<td>전환률</td>
<td>9.55</td>
</tr>
<tr>
<td>Conversions</td>
<td>구매 전환</td>
<td>322</td>
</tr>
<tr>
<td>Cost</td>
<td>소모 비용</td>
<td>1967.89</td>
</tr>
<tr>
<td>Engagement Rate</td>
<td>참여율</td>
<td>9.73</td>
</tr>
<tr>
<td>Engagement Time</td>
<td>참여 시간</td>
<td>313</td>
</tr>
<tr>
<td>Impressions</td>
<td>캠페인 노출횟수</td>
<td>52265</td>
</tr>
<tr>
<td>Revenue</td>
<td>매출</td>
<td>44627.27</td>
</tr>
<tr>
<td>ROI</td>
<td>투자 대비 수익</td>
<td>4.54</td>
</tr>
</tbody></table>
<h3 id="campaign-objective">Campaign Objective</h3>
<p><strong>Engagement</strong>    수신자의 긍정적인 반응을 이끌어내는 것
<strong>Conversion</strong>    고객이 구매, 앱 다운로드, 메일 링리스트 가입 등의 특정한 기대 행동을 완료하는 것
<strong>Awareness</strong>    마케팅 캠페인, 소비자 조사 및 발굴을 통해 잠재 고객을 이 단계로 끌어들임</p>
<h3 id="activity-type">Activity Type</h3>
<p><strong>PPC</strong>    고객이 클릭할 때마다 광고주들이 비용을 지불하는 온라인 광고 시스템인 Pay-Per-click(이하 클릭당 과금)의 약자
<strong>Affiliate</strong>    제휴 마케팅. 웹사이트 발행자가 그의 노력에 의해 파트너의 웹사이트에 새로 방문자, 회원, 고객, 매출을 발생시키면
그 웹사이트 발행자는 소정의 보상을 받는 식의 마케팅 기법
<strong>Content Marketing</strong>    설정된 대상에 맞춰 일관된 콘텐츠를 개발 및 배포하여 선정된 개인 또는 대상자 세그먼트를 유지 미치 확보하는 데 중점을 둔 디지털 마케팅 전략
<strong>SEO</strong>    검색 엔진 최적화 활동을 통해 검색 엔진 결과에서 브랜드의 웹사이트가 더 많이 또는 상위에 노출되는 것을 목표로 하는 마케팅의 유형</p>
<h3 id="source">Source</h3>
<p><strong>Paid (유료 트래픽)</strong>    광고를 통해 유입된 트래픽입니다.  ex) 예시: 구글 애드워즈, 페이스북 광고, 네이버 광고 등 유료 마케팅 채널에서 발생한 방문입니다.
비용을 지불한 캠페인이나 클릭을 통해 들어온 사용자들입니다.
<strong>Referral (추천 트래픽)</strong>    다른 웹사이트나 링크를 통해 유입된 트래픽 ex)  뉴스 기사, 블로그 링크, 외부 사이트에 게시된 링크를 통해 들어온 방문자
직접적인 광고가 아닌 타 사이트의 링크가 주요 역할을 합니다.
<strong>Direct (직접 트래픽)</strong>    사용자가 URL을 직접 입력하거나 북마크를 통해 사이트에 접속했을 때 발생하는 트래픽입니다.
예시: 브라우저 주소창에 <a href="http://www.example.com%EC%9D%84">www.example.com을</a> 직접 입력하거나, 즐겨찾기에 저장된 링크로 접속한 경우입니다.
UTM 태그나 리퍼러 정보가 없는 경우도 포함될 수 있습니다.</p>
<h3 id="conversion-funnel-stage">Conversion Funnel Stage</h3>
<p>단계    고객 심리    주요 활동    목표
<strong>Awareness(TOFU)</strong>    제품에 대해 처음 알게 됨    소셜 미디어 광고, SEO, PPC 광고    브랜드 인지도 증가
<strong>Consideration(MOFU)</strong>    제품 비교 및 관심    상세 정보 제공, 리타겟팅, 리뷰 제공    구매 후보군으로 고려 유도
<strong>Decision(BOFU)</strong>    구매 결정을 내리는 단계    할인 제공, 결제 최적화, 긴급성 부여    전환(구매) 유도</p>
<h2 id="컬럼을-통한-지표-도출">컬럼을 통한 지표 도출</h2>
<h3 id="1-클릭-관련-지표ctr"><strong>1. 클릭 관련 지표(CTR)</strong></h3>
<ul>
<li><p><strong>CTR (Click-Through Rate):</strong></p>
<pre><code class="language-jsx">  CTR (%) = (Clicks / Impressions) * 100</code></pre>
<ul>
<li><strong>사용 컬럼</strong>: <code>Clicks</code>, <code>Impressions</code></li>
<li>캠페인 노출 대비 클릭 비율을 나타냄.</li>
</ul>
</li>
</ul>
<h3 id="2-전환-관련-지표cvr-cpa"><strong>2. 전환 관련 지표(CVR, CPA)</strong></h3>
<ul>
<li><p><strong>전환율 (Conversion Rate):</strong></p>
<pre><code class="language-jsx">  Conversion Rate (%) = (Conversions / Clicks) * 100</code></pre>
<ul>
<li><strong>사용 컬럼</strong>: <code>Conversions</code>, <code>Clicks</code></li>
<li>클릭한 사용자 중 전환(구매, 등록 등)한 비율.</li>
</ul>
</li>
<li><p><strong>CPA (Cost Per Acquisition):</strong></p>
<pre><code class="language-jsx">  CPA = Cost / Conversions</code></pre>
<ul>
<li><strong>사용 컬럼</strong>: <code>Cost</code>, <code>Conversions</code></li>
<li>전환 1건당 비용.</li>
</ul>
</li>
</ul>
<h3 id="3-비용-관련-지표"><strong>3. 비용 관련 지표</strong></h3>
<ul>
<li><p><strong>CPC (Cost Per Click):</strong></p>
<pre><code class="language-jsx">  CPC = Cost / Clicks</code></pre>
<ul>
<li><strong>사용 컬럼</strong>: <code>Cost</code>, <code>Clicks</code></li>
<li>클릭당 평균 비용.</li>
</ul>
</li>
<li><p><strong>CPM (Cost Per Mille):</strong></p>
<pre><code class="language-jsx">  CPM = (Cost / Impressions) * 1000</code></pre>
<ul>
<li><strong>사용 컬럼</strong>: <code>Cost</code>, <code>Impressions</code></li>
<li>1000회 노출당 비용.</li>
</ul>
</li>
</ul>
<h3 id="4-수익성-관련-지표"><strong>4. 수익성 관련 지표</strong></h3>
<ul>
<li><p><strong>ROI (Return on Investment):</strong></p>
<pre><code class="language-jsx">  ROI = (Revenue - Cost) / Cost</code></pre>
<ul>
<li><strong>사용 컬럼</strong>: <code>Revenue</code>, <code>Cost</code></li>
<li>투자 대비 수익률.</li>
</ul>
</li>
<li><p><strong>ROAS (Return on Ad Spend):</strong></p>
<pre><code class="language-jsx">  ROAS = Revenue / Cost</code></pre>
<ul>
<li><strong>사용 컬럼</strong>: <code>Revenue</code>, <code>Cost</code></li>
<li>광고비 대비 매출 비율.</li>
</ul>
</li>
</ul>
<h3 id="5-참여-및-가시성-지표"><strong>5. 참여 및 가시성 지표</strong></h3>
<ul>
<li><p><strong>Engagement Rate (참여율):</strong></p>
<p>  이미 데이터셋에 <code>Engagement Rate</code>가 제공됨.</p>
</li>
<li><p><strong>Engagement Time (참여 시간):</strong></p>
<p>  참여 시간(<code>Engagement Time</code>) 데이터도 제공됨.</p>
</li>
<li><p><strong>Visibility (가시성):</strong></p>
<p>  특정 캠페인의 시각적 노출 또는 브랜드 인지도.</p>
</li>
</ul>
<h3 id="6-캠페인-성과-비교-지표"><strong>6. 캠페인 성과 비교 지표</strong></h3>
<ul>
<li><strong>Impressions 대비 Revenue 비율</strong>: 광고 노출 대비 수익 기여도 평가.</li>
</ul>
<pre><code class="language-jsx">Revenue / Impressions</code></pre>
<ul>
<li><strong>Campaign Duration</strong>을 기준으로 <code>Revenue</code>, <code>Cost</code>를 나누어 <strong>기간당 성과</strong>를 분석.<pre><code class="language-jsx">Revenue / Campaign Duration
Cost / Campaign Duration</code></pre>
</li>
</ul>
]]></description>
        </item>
        <item>
            <title><![CDATA[[태블로] 실습으로 배우는 태블로 과제]]></title>
            <link>https://velog.io/@hey_min_37/%ED%83%9C%EB%B8%94%EB%A1%9C-%EC%8B%A4%EC%8A%B5%EC%9C%BC%EB%A1%9C-%EB%B0%B0%EC%9A%B0%EB%8A%94-%ED%83%9C%EB%B8%94%EB%A1%9C-%EA%B3%BC%EC%A0%9C</link>
            <guid>https://velog.io/@hey_min_37/%ED%83%9C%EB%B8%94%EB%A1%9C-%EC%8B%A4%EC%8A%B5%EC%9C%BC%EB%A1%9C-%EB%B0%B0%EC%9A%B0%EB%8A%94-%ED%83%9C%EB%B8%94%EB%A1%9C-%EA%B3%BC%EC%A0%9C</guid>
            <pubDate>Mon, 16 Dec 2024 13:01:51 GMT</pubDate>
            <description><![CDATA[<p>📖 <strong>필수 1: 데이터 연결 및 준비</strong></p>
<ul>
<li>제공된 <strong>세계 행복 보고서 2023</strong> (<code>WHR_2023.csv</code>) 데이터를 Tableau에 연결해주세요.</li>
<li>데이터셋의 주요 컬럼은 다음과 같습니다:<ul>
<li>Region (지역)</li>
<li>Country (국가)</li>
<li>Happiness Score (행복 점수)</li>
<li>GDP per Capita (1인당 GDP)</li>
<li>Social Support (사회적 지원 점수)</li>
<li>Healthy Life Expectancy (건강한 기대수명)</li>
<li>Generosity (관대함 지수)</li>
<li>Freedom to Make Life Choices (삶의 선택 자유도)</li>
<li>등</li>
</ul>
</li>
</ul>
<p><strong>📚나의 답</strong>
<img src="https://velog.velcdn.com/images/hey_min_37/post/21e0ad91-d231-4632-b3e9-e8e75938c642/image.png" alt=""></p>
<p>필요한 데이터를 컴퓨터에서 업로드 해서 데이터를 연결해 줍니다.</p>
<hr>
<p>📖 <strong>필수 2: Big Numbers</strong></p>
<ul>
<li><strong>Happiness Score</strong>, <strong>GDP per Capita</strong>, <strong>Healthy Life Expectancy</strong>의 평균값을 나타내는 세 개의 Big Numbers를 만들어주세요.</li>
<li>평균값을 소수점 둘째 자리까지 표시하고, 적절한 제목을 추가해주세요.</li>
<li>각 시각화 별 별도의 Worksheet 에 작성해주세요.</li>
</ul>
<p><strong>📚나의 답</strong></p>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/9197de94-d1af-432d-8d75-964a475cfd74/image.png" alt=""></p>
<hr>
<p>📖 <strong>필수 3: 지역별 비교 시각화 (Bar Chart)</strong></p>
<ul>
<li>Region별 평균 Happiness Score를 나타내는 Bar Chart를 생성해주세요.</li>
<li>막대그래프에 Happiness Score를 내림차순으로 정렬해주세요.</li>
<li>그래프에 각 값의 라벨을 추가하여 점수를 명확히 표시해주세요.</li>
</ul>
<p><strong>📚나의 답</strong>
<img src="https://velog.velcdn.com/images/hey_min_37/post/fd4c063e-98dd-4df3-851d-f0c535d39f64/image.png" alt=""></p>
<hr>
<p>📖 <strong>필수 4: 비교 분석 (Scatter Plot)</strong></p>
<ul>
<li>GDP per Capita와 Happiness Score 간의 관계를 분석하는 Scatter Plot을 생성해주세요.</li>
<li>GDP per Capita를 X축, Happiness Score를 Y축으로 설정해주세요.</li>
<li>Region(지역)별 색상을 추가하여 지역별 패턴을 비교해주세요.</li>
</ul>
<p><strong>📚나의 답</strong>
<img src="https://velog.velcdn.com/images/hey_min_37/post/1ad2fb8d-cb08-4d70-98b0-0c35cfe519ab/image.png" alt=""></p>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/4e46a19a-0778-4a92-9838-7a448c096a0d/image.png" alt=""></p>
<p>📌 포인트는 스캐터 플롯 만들때 &#39;차원&#39;인지, &#39;연속형&#39;인지 확인하는 것
<img src="https://velog.velcdn.com/images/hey_min_37/post/2f0315d2-b222-436e-8b9b-e082e00bb0cc/image.png" alt="">
📌 색상에 REGION 설정</p>
<hr>
<p>📖 <strong>필수 5: 대시보드 제작</strong></p>
<ul>
<li>앞에서 제작한 Worksheet를 결합하여 대시보드를 제작해주세요.</li>
<li>대시보드에는 다음 요소를 포함해주세요:<ul>
<li>제목: “세계 행복 보고서 대시보드”</li>
<li>필수 1-4에서 만들었던 시각화를 추가해주세요.</li>
<li>대시보드 필터:<ul>
<li>Region 필드를 기반으로 모든 Worksheet에 적용되는 범위 필터</li>
<li><em>다중값 (드롭다운)</em></li>
</ul>
</li>
<li>적절한 레이아웃과 시각적 일관성</li>
</ul>
</li>
</ul>
<p><strong>📚나의 답</strong>
<img src="https://velog.velcdn.com/images/hey_min_37/post/9aa2772f-293e-446b-b338-6086f892d226/image.png" alt=""></p>
<hr>
<p><strong>🚨 도전 1: LOD Expressions을 활용한 분석</strong></p>
<ul>
<li>지역(Region)별 1인당 GDP(GDP per capita)가 해당 국가의 지역 평균보다 높은지 여부를 나타내는 새로운 계산 필드를 생성하고 대시보드에 적용해주세요.<ul>
<li>이 값을 기준으로 <code>평균 초과</code> 또는 <code>평균 미만</code> 값을 표시하는 새로운 계산된 필드를 생성해주세요.</li>
<li>이름은 “지역 평균 GDP 필터”으로 정의해주세요.</li>
</ul>
</li>
</ul>
<p><strong>📚나의 답</strong>
<img src="https://velog.velcdn.com/images/hey_min_37/post/b8506667-fd1d-42ae-8b9e-09c45a803d80/image.png" alt="">
📌 IF함수와 LOD표현식 중 FIXED를 사용해 지역 평균 GDP필터를 만들었다.
📌 IF문과 LOD계산식 참고 블로그
<a href="https://ssongblog.tistory.com/43">IF 함수</a>
<a href="https://m.blog.naver.com/forhermit/221617323611">알기 쉬운 LOD-FIXED편</a></p>
<hr>
<p><strong>🚨 도전 2: 변수간 관계를 분석</strong></p>
<ul>
<li>필수 4: 비교 분석에서 여러 지표를 추가로 생성해주세요.<ul>
<li>X축 평균, Y축 평균 값을 추가해주세요.</li>
<li>Trend Line(추세선)을 추가하여 관계를 시각화해주세요.</li>
</ul>
</li>
</ul>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/e175de69-856e-4335-a94b-6bbe26473099/image.png" alt=""></p>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/c7d326d5-15a5-44cc-91b6-c8a67288e953/image.png" alt=""></p>
<p>📌 추세선과 평균라인은 왼쪽 분석 패널에서 드래그만으로 쉽게 그릴 수 있습니다.</p>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/a8ae0c9c-d6c1-4d38-9aec-2c908a999318/image.png" alt=""></p>
<p>📌 평균 : &lt;값&gt;을 선 우클릭 후 편집에서 사용자 지정으로 지정해줄 수 있습니다.</p>
<hr>
<p><strong>🏆과제 회고</strong>
지급해준 강의와 특강에서 나오지 않은 부분이 많아서 구글링 해가며 하느라 시간이 오래 걸렸다. 하지만, 구글링하는 과정에서 또 이것저것 찾고 많이 눌러보면서 태블로 기능에 대해 더 많이 알 수 있는 시간이었다.</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[WIL] 12월 둘째주]]></title>
            <link>https://velog.io/@hey_min_37/WIL-12%EC%9B%94-%EB%91%98%EC%A7%B8%EC%A3%BC</link>
            <guid>https://velog.io/@hey_min_37/WIL-12%EC%9B%94-%EB%91%98%EC%A7%B8%EC%A3%BC</guid>
            <pubDate>Fri, 13 Dec 2024 11:02:50 GMT</pubDate>
            <description><![CDATA[<p><strong>QCC</strong>
-&gt; 다음에는 다 맞출 수 있도록 특단의 조치가 필요함
-&gt; 오전에 1시간 동안 밀도 있게 집중하기 위해 9시에 미니스크럼 진행하기로</p>
<p><strong>태블로</strong>
-&gt; 스파르타에서 제공하는 강의로는 이해도가 부족. 부스트코스라는 태블로 강의를 통해 좀 이해도를 높여야 함.
-&gt; 주말에 태블로 강의 완강
-&gt; 과제 해결하는 과정을 통해 실력 키우기</p>
<p><strong>심화프로젝트 준비</strong>
-&gt; 관심가는 주제에 대한 데이터셋 살펴보기</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[QCC] 4회차]]></title>
            <link>https://velog.io/@hey_min_37/QCC-4%ED%9A%8C%EC%B0%A8</link>
            <guid>https://velog.io/@hey_min_37/QCC-4%ED%9A%8C%EC%B0%A8</guid>
            <pubDate>Fri, 13 Dec 2024 10:54:47 GMT</pubDate>
            <description><![CDATA[<h2 id="문제-1-下">문제 1 <code>(下)</code></h2>
<hr>
<ul>
<li>테이블 설명 :</li>
</ul>
<p><strong><code>stores</code></strong> 테이블은 각 매장에 대한 정보를 담고 있습니다. 테이블 구조는 다음과 같으며, STORE_NAME, REGION_NAME, SALES, EMPLOYEES, OPEN_DATE, TYPE은 
각각 매장 ID, 지역 이름, 매출, 직원 수, 개점일, 매장 유형을 나타냅니다.  </p>
<table>
<thead>
<tr>
<th>컬럼명</th>
<th>타입</th>
<th>설명</th>
</tr>
</thead>
<tbody><tr>
<td>STORE_ID</td>
<td>VARCHAR</td>
<td>매장 ID (PK)</td>
</tr>
<tr>
<td>REGION_NAME</td>
<td>VARCHAR</td>
<td>지역 이름</td>
</tr>
<tr>
<td>SALES</td>
<td>NUMERIC</td>
<td>매출</td>
</tr>
<tr>
<td>EMPLOYEES</td>
<td>INT</td>
<td>직원 수</td>
</tr>
<tr>
<td>OPEN_DATE</td>
<td>DATE</td>
<td>개점일</td>
</tr>
<tr>
<td>TYPE</td>
<td>VARCHAR</td>
<td>매장 유형</td>
</tr>
</tbody></table>
<hr>
<ul>
<li>분석해야 할 내용은 다음과 같습니다 :</li>
</ul>
<hr>
<p><strong>지역별</strong>로 <strong>매출이 가장 높은 매장</strong>을 조회하는 SQL 문을 작성해주세요. 
단, <strong>해당 지역에 매장이 두 개 이상</strong>인 경우만 결과에 포함해주세요. 
결과는 <strong>지역 이름</strong>을 기준으로 오름차 정렬해주세요</p>
<h3 id="출력-값-예시">출력 값 예시</h3>
<p><strong><code>stores</code></strong> 테이블이 다음과 같다면 : </p>
<table>
<thead>
<tr>
<th>STORE_ID</th>
<th>REGION_NAME</th>
<th>SALES</th>
<th>EMPLOYEES</th>
<th>OPEN_DATE</th>
<th>TYPE</th>
</tr>
</thead>
<tbody><tr>
<td>1</td>
<td>Seoul</td>
<td>1000.5</td>
<td>10</td>
<td>5/1/2020</td>
<td>Retail</td>
</tr>
<tr>
<td>2</td>
<td>Seoul</td>
<td>1500.75</td>
<td>15</td>
<td>3/15/2019</td>
<td>Retail</td>
</tr>
<tr>
<td>3</td>
<td>Seoul</td>
<td>100.00</td>
<td>5</td>
<td>3/12/2020</td>
<td>Retail</td>
</tr>
<tr>
<td>4</td>
<td>Busan</td>
<td>2000</td>
<td>20</td>
<td>6/10/2021</td>
<td>Wholesale</td>
</tr>
<tr>
<td>5</td>
<td>Daegu</td>
<td>1200.25</td>
<td>12</td>
<td>7/30/2018</td>
<td>Retail</td>
</tr>
<tr>
<td>6</td>
<td>Daegu</td>
<td>900</td>
<td>8</td>
<td>9/20/2020</td>
<td>Retail</td>
</tr>
<tr>
<td>7</td>
<td>Incheon</td>
<td>500</td>
<td>5</td>
<td>1/15/2022</td>
<td>Retail</td>
</tr>
<tr>
<td>- <strong>Seoul</strong> 지역에는 매장이 3 개 있으며, 매출이 가장 높은 매장은 STORE_ID <code>2</code>입니다.</td>
<td></td>
<td></td>
<td></td>
<td></td>
<td></td>
</tr>
<tr>
<td>- <strong>Busan</strong> 지역에는 매장이 하나만 있습니다. 따라서 결과에 포함되지 않습니다.</td>
<td></td>
<td></td>
<td></td>
<td></td>
<td></td>
</tr>
<tr>
<td>- <strong>Daegu</strong> 지역에는 매장이 2 개 있으며, 매출이 가장 높은 매장은 STORE_ID <code>5</code>입니다.</td>
<td></td>
<td></td>
<td></td>
<td></td>
<td></td>
</tr>
<tr>
<td>- <strong>Incheon</strong> 지역에는 매장이 하나만 있습니다. 따라서 결과에 포함되지 않습니다.</td>
<td></td>
<td></td>
<td></td>
<td></td>
<td></td>
</tr>
</tbody></table>
<hr>
<p>다음과 같이 결과 출력이 되어야 합니다.
(해당 테이블은 예시이며, 실제 정답과 다를 수 있습니다.)</p>
<p><strong>📚나의 답</strong></p>
<pre><code class="language-sql">SELECT REGION_NAME, MAX(SALES) AS highest_sales 
FROM stores
WHERE REGION_NAME IN (SELECT REGION_NAME FROM stores GROUP BY REGION_NAME HAVING COUNT(*)&gt;=2)
GROUP BY REGION_NAME 
ORDER BY REGION_NAME; </code></pre>
<p><strong>📚튜터님 답</strong></p>
<pre><code class="language-sql">select REGION_NAME, max(SALES)
from stores
group by 1 
HAVING count(distinct STORE_ID) &gt; 1
order by 1</code></pre>
<h2 id="문제-2-中">문제 2 <code>(中)</code></h2>
<hr>
<ul>
<li>테이블 설명 :</li>
</ul>
<p><strong><code>payments</code></strong> 테이블은 사용자의 결제 정보를 포함합니다. 테이블 구조는 다음과 같으며, 
ID, USER_ID, AMOUNT, PAY_DATE, 그리고 PAYMENT_TYPE은 
각각 결제 ID, 사용자 ID, 결제 금액, 결제 날짜, 결제 유형(카드, 현금 등)을 나타냅니다.</p>
<table>
<thead>
<tr>
<th>컬럼명</th>
<th>타입</th>
<th>설명</th>
</tr>
</thead>
<tbody><tr>
<td>ID</td>
<td>INT</td>
<td>결제 ID (PK)</td>
</tr>
<tr>
<td>USER_ID</td>
<td>VARCHAR</td>
<td>사용자 ID</td>
</tr>
<tr>
<td>AMOUNT</td>
<td>INT</td>
<td>결제 금액</td>
</tr>
<tr>
<td>PAY_DATE</td>
<td>DATETIME</td>
<td>결제 날짜</td>
</tr>
<tr>
<td>PAYMENT_TYPE</td>
<td>INT</td>
<td>결제 유형 (0: 현금, 1:카드)</td>
</tr>
</tbody></table>
<p><strong><code>orders</code></strong> 테이블은 사용자의 상품 배송 정보를 포함합니다. 테이블 구조는 다음과 같으며, 
ID, USER_ID, ORDER_DATE, 그리고 ITEM은 
각각 주문 ID, 사용자 ID, 주문 날짜, 주문한 상품명을 나타냅니다. 
해당 테이블의 USER_ID 는 payments 테이블의 USER_ID랑 동일합니다.</p>
<ul>
<li>분석해야 할 내용은 다음과 같습니다 :</li>
</ul>
<hr>
<p>최근 특정 사용자들이 <strong>결제를 하지 않고 상품을 주문</strong>하거나, 
<strong>결제를 하지 않은 시점에 이미 상품을 주문</strong>하는 버그가 발견되었습니다. 🐞 
해당 버그를 악용한 사용자를 파악하기 위해 SQL 문을 작성해주세요. 
다음 조건에 해당되는 사용자 수를 출력해주세요 :</p>
<ul>
<li>결제를 하지 않고 상품을 주문한 사용자</li>
<li>첫 번째 결제일보다 이전에 상품을 주문한 사용자</li>
</ul>
<hr>
<h3 id="출력-값-예시-1">출력 값 예시</h3>
<p><strong><code>payments</code></strong> 테이블이 다음과 같고 : </p>
<table>
<thead>
<tr>
<th>ID</th>
<th>USER_ID</th>
<th>AMOUNT</th>
<th>PAY_DATE</th>
<th>PAYMENT_TYPE</th>
</tr>
</thead>
<tbody><tr>
<td>1</td>
<td>user1</td>
<td>3000</td>
<td>2023-01-23 10:00:00</td>
<td>0</td>
</tr>
<tr>
<td>2</td>
<td>user3</td>
<td>5000</td>
<td>2023-01-23 14:00:00</td>
<td>1</td>
</tr>
<tr>
<td>3</td>
<td>user5</td>
<td>7000</td>
<td>2023-02-23 12:00:00</td>
<td>0</td>
</tr>
</tbody></table>
<p><strong><code>orders</code></strong> 테이블이 다음과 같다면 :</p>
<ul>
<li><strong>user1</strong>은 결제 후 상품을 주문했으므로 버그와 무관합니다.</li>
<li><strong>user2</strong>는 결제를 하지 않고 상품을 주문했습니다. 버그를 악용했습니다.</li>
<li><strong>user4</strong>는 결제를 하지 않고 상품을 주문했습니다. 버그를 악용했습니다.</li>
<li><strong>user5</strong>는 첫 번째 결제일 이전에 상품을 주문했습니다. 버그를 악용했습니다.</li>
</ul>
<hr>
<p>다음과 같이 결과 출력이 되어야 합니다.
(해당 테이블은 예시이며, 실제 정답과 다를 수 있습니다.)</p>
<table>
<thead>
<tr>
<th>cnt</th>
</tr>
</thead>
<tbody><tr>
<td>3</td>
</tr>
</tbody></table>
<hr>
<p><strong>📚나의 답</strong></p>
<pre><code class="language-sql">x</code></pre>
<p><strong>📚튜터님 답</strong></p>
<pre><code class="language-sql">WITH first_payment AS (
    SELECT 
        USER_ID, 
        MIN(PAY_DATE) AS FIRST_PAY_DATE
    FROM qcc.payments
    GROUP BY USER_ID
)
SELECT 
   COUNT(DISTINCT o.USER_ID) cnt 
FROM qcc.orders o
LEFT JOIN first_payment fp
ON o.USER_ID = fp.USER_ID
WHERE fp.USER_ID IS NULL 
   OR o.ORDER_DATE &lt; fp.FIRST_PAY_DATE</code></pre>
<p>시간이 없어서 풀지 못했다..</p>
<hr>
<h2 id="문제-3-上">문제 3 <code>(上)</code></h2>
<hr>
<ul>
<li>테이블 설명</li>
</ul>
<p><strong><code>cart_products</code></strong> 테이블은 쇼핑 카트에서 주문된 아이템에 대한 정보를 담고 있습니다. 
테이블 구조는 다음과 같으며, ID, CART_ID, NAME, PRICE는 
각각 제품 ID, 주문 번호, 제품 이름, 개별 제품 가격을 나타냅니다.</p>
<table>
<thead>
<tr>
<th>컬럼명</th>
<th>타입</th>
<th>설명</th>
</tr>
</thead>
<tbody><tr>
<td>ID</td>
<td>INT</td>
<td>제품 ID</td>
</tr>
<tr>
<td>CART_ID</td>
<td>INT</td>
<td>주문 번호</td>
</tr>
<tr>
<td>NAME</td>
<td>VARCHAR</td>
<td>제품 이름</td>
</tr>
<tr>
<td>PRICE</td>
<td>INT</td>
<td>제품 가격 (원 단위)</td>
</tr>
</tbody></table>
<hr>
<ul>
<li>분석해야 할 내용은 다음과 같습니다 :</li>
</ul>
<hr>
<p>데이터 분석팀은 고객이 특정 상품 X를 구매했을 때 상품 Y도 함께 구매할 확률을 분석하고자 합니다. 
이를 위해, 쇼핑 카트 데이터에서 서로 다른 두 제품 X와 Y가 같은 주문(CART_ID)에 포함된 주문 수를 확인하려고 합니다.</p>
<ul>
<li>제품 X와 Y가 같은 주문에 포함된 경우를 계산합니다.</li>
<li>두 제품은 서로 다른 이름이어야 하며, 한 쌍의 경우(예: Coffee와 Sausages)는 다른 순서(예: Sausages와 Coffee)로도 포함됩니다.</li>
<li>결과는 각 제품 쌍과 해당 제품이 함께 포함된 주문 수를 반환해야 합니다.</li>
<li><strong>제품 이름 X와 Y를 기준으로 알파벳 순</strong>으로 오름차순 정렬합니다.</li>
</ul>
<hr>
<h3 id="출력-값-예시-2">출력 값 예시</h3>
<p><code>cart_products</code> 테이블이 다음과 같다면 : </p>
<table>
<thead>
<tr>
<th>ID</th>
<th>CART_ID</th>
<th>NAME</th>
<th>PRICE</th>
</tr>
</thead>
<tbody><tr>
<td>1</td>
<td>1</td>
<td>Coffee</td>
<td>3000</td>
</tr>
<tr>
<td>2</td>
<td>1</td>
<td>Sausages</td>
<td>4000</td>
</tr>
<tr>
<td>3</td>
<td>1</td>
<td>Vegetable</td>
<td>2000</td>
</tr>
<tr>
<td>4</td>
<td>2</td>
<td>Coffee</td>
<td>3000</td>
</tr>
<tr>
<td>5</td>
<td>2</td>
<td>Bread</td>
<td>1500</td>
</tr>
<tr>
<td>6</td>
<td>2</td>
<td>Sausages</td>
<td>4000</td>
</tr>
<tr>
<td>7</td>
<td>3</td>
<td>Vegetable</td>
<td>2000</td>
</tr>
<tr>
<td>8</td>
<td>3</td>
<td>Bread</td>
<td>1500</td>
</tr>
</tbody></table>
<hr>
<p>다음과 같이 결과 출력이 되어야 합니다.
(해당 테이블은 예시이며, 실제 정답과 다를 수 있습니다.) </p>
<table>
<thead>
<tr>
<th>name_x</th>
<th>name_y</th>
<th>orders</th>
</tr>
</thead>
<tbody><tr>
<td>Bread</td>
<td>Coffee</td>
<td>1</td>
</tr>
<tr>
<td>Bread</td>
<td>Sausages</td>
<td>1</td>
</tr>
<tr>
<td>Bread</td>
<td>Vegetable</td>
<td>1</td>
</tr>
<tr>
<td>Coffee</td>
<td>Bread</td>
<td>1</td>
</tr>
<tr>
<td>Coffee</td>
<td>Sausages</td>
<td>2</td>
</tr>
<tr>
<td>Coffee</td>
<td>Vegetable</td>
<td>1</td>
</tr>
<tr>
<td>Sausages</td>
<td>Bread</td>
<td>1</td>
</tr>
<tr>
<td>Sausages</td>
<td>Coffee</td>
<td>2</td>
</tr>
<tr>
<td>Sausages</td>
<td>Vegetable</td>
<td>1</td>
</tr>
<tr>
<td>Vegetable</td>
<td>Bread</td>
<td>1</td>
</tr>
<tr>
<td>Vegetable</td>
<td>Coffee</td>
<td>1</td>
</tr>
<tr>
<td>Vegetable</td>
<td>Sausages</td>
<td>1</td>
</tr>
<tr>
<td></aside></td>
<td></td>
<td></td>
</tr>
</tbody></table>
<hr>
<p><strong>📚나의 답</strong></p>
<pre><code class="language-sql">SELECT cp1.NAME AS NAME_X, cp2.NAME AS NAME_Y, COUNT(*) AS ORDERS
FROM cart_products cp1
JOIN cart_products cp2
ON cp1.CART_ID = cp2.CART_ID 
GROUP BY NAME_X, NAME_Y
ORDER BY NAME_X, NAME_Y;</code></pre>
<p><strong>📚튜터님 답</strong></p>
<pre><code class="language-sql">SELECT 
    A.NAME AS name_x, 
    B.NAME AS name_y, 
    COUNT(DISTINCT A.CART_ID) as orders 
FROM cart_products A
JOIN cart_products B
ON A.CART_ID = B.CART_ID AND A.NAME &lt;&gt; B.NAME
GROUP BY A.NAME, B.NAME
ORDER BY A.NAME, B.NAME;</code></pre>
<p>A.NAME &lt;&gt; B.NAME 조건을 빼먹음😥</p>
<hr>
<p>다 맞추는게 항상 목표인데 쉽지않다... 다음 시험에서는 기필코... 제발...</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[과제] 통계학&머신러닝]]></title>
            <link>https://velog.io/@hey_min_37/%EA%B3%BC%EC%A0%9C-%ED%86%B5%EA%B3%84%ED%95%99%EB%A8%B8%EC%8B%A0%EB%9F%AC%EB%8B%9D</link>
            <guid>https://velog.io/@hey_min_37/%EA%B3%BC%EC%A0%9C-%ED%86%B5%EA%B3%84%ED%95%99%EB%A8%B8%EC%8B%A0%EB%9F%AC%EB%8B%9D</guid>
            <pubDate>Thu, 12 Dec 2024 10:53:58 GMT</pubDate>
            <description><![CDATA[<h2 id="통계학머신러닝-과제">통계학&amp;머신러닝 과제</h2>
<h3 id="필수-1-기초통계">필수 1. 기초통계</h3>
<ul>
<li>statistics csv 파일을 읽고, 성별 Review Rating 에 대한 평균과 중앙값을 구해주세요. 결과는 소수점 둘째자리까지 표현해주세요.</li>
<li>그리고 이에 대한 해석을 간략하게 설명해주세요.</li>
</ul>
<p><strong>✍나의 답</strong></p>
<pre><code class="language-python"># 라이브러리 호출 
import pandas as pd
import numpy as np 

# 과학 계산용 파이썬 라이브러리 
import scipy.stats as stats
import warnings 
warnings.filterwarnings(&#39;ignore&#39;)
df = pd.read_csv(&quot;statistics.csv&quot;)

# Review Rating 에 대한 평균
mean = df.groupby([&#39;Gender&#39;])[&#39;Review Rating&#39;].mean().round(2)

# Review Rating 에 대한 중앙값
median = df.groupby([&#39;Gender&#39;])[&#39;Review Rating&#39;].median().round(2)

print(f&quot;평균: {mean}&quot;)
print(f&quot;중앙값: {median}&quot;)</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/398abb68-d97e-401b-a001-c83863648e43/image.png" alt=""></p>
<p><strong>✍튜터님 답</strong></p>
<pre><code class="language-python">df.groupby([&#39;Gender&#39;])[&#39;Review Rating&#39;].agg([&#39;mean&#39;,&#39;median&#39;]).round(2).reset_index()</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/5a217521-a8f5-416f-b360-264b02024743/image.png" alt=""></p>
<hr>
<h3 id="필수-2-통계적-가설검정">필수 2. 통계적 가설검정</h3>
<ul>
<li><strong>성별, Review Rating 컬럼에 대한 T-TEST 를 진행해주세요.</strong><ul>
<li>귀무가설과 대립가설을 작성해주세요.</li>
<li>t-score, P-value 를 구해주세요.</li>
<li>그리고 이에 대한 귀무가설 채택/기각 여부와 그렇게 생각한 이유를 간략하게 설명해주세요.</li>
</ul>
</li>
</ul>
<p><strong>✍나의 답</strong></p>
<pre><code class="language-python"># 데이터 분리 
# mask method 
mask=(df[&#39;Gender&#39;]==&#39;Male&#39;)
mask1 = (df[&#39;Gender&#39;]==&#39;Female&#39;)

m_rr =df[mask]
f_rr =df[mask1]

# 별점 컬럼만 가져오기 
m_rr=m_rr[[&#39;Review Rating&#39;]]
f_rr=f_rr[[&#39;Review Rating&#39;]]

# t-test
t, pvalue = stats.ttest_ind(f_rr, m_rr)

#결과 출력
print(f&quot;t-score: {t}&quot;)
print(f&quot;p-value: {pvalue}&quot;)</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/a998810e-5296-4c13-b39b-1122db187374/image.png" alt=""></p>
<p><strong>✍튜터님 답</strong></p>
<pre><code class="language-python">mask=(df[&#39;Gender&#39;]==&#39;Male&#39;)
mask1 = (df[&#39;Gender&#39;]==&#39;Female&#39;)
m_df = df[mask]
f_df = df[mask1]

# 결제금액 컬럼만 가져오기 
m_df=m_df[[&#39;Review Rating&#39;]]
f_df=f_df[[&#39;Review Rating&#39;]]

t, pvalue=stats.ttest_ind(f_df, m_df)

t, pvalue</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/8a8366bb-87d8-4b06-9d9a-023902e25542/image.png" alt=""></p>
<hr>
<h3 id="필수-3-통계적-가설검정2"><strong>필수 3. 통계적 가설검정2</strong></h3>
<ul>
<li><strong>Color, Season 컬럼에 대한 카이제곱 검정을 진행해주세요.</strong><ul>
<li>귀무가설과 대립가설을 작성해주세요.</li>
<li>두 범주형 자료의 빈도표를 만들어주세요. 이를 코드로 작성하여 기재해주세요.</li>
<li>카이제곱통계량, P-value 를 구해주세요.</li>
<li>그리고 이에 대한 귀무가설 채택/기각 여부와 그렇게 생각한 이유를 간략하게 설명해주세요.</li>
</ul>
</li>
</ul>
<p><strong>✍나의 답</strong></p>
<pre><code class="language-python">#빈도표 만들기
result = pd.crosstab(df[&#39;Color&#39;],df[&#39;Season&#39;])

#카이제곱검정
stats.chi2_contingency(observed=result)

#검정통계량
Chi_square = stats.chi2_contingency(observed=result)[0]
#p-value
p_value = stats.chi2_contingency(observed=result)[1]

#결과 출력
print(f&quot;검정통계량: {Chi_square:.2f}&quot;)
print(f&quot;p-value: {p_value:.2f}&quot;)</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/cae94ca3-6269-4044-957c-ef6ff8276dcd/image.png" alt=""></p>
<p><strong>✍튜터님 답</strong>   </p>
<pre><code class="language-python">result = pd.crosstab(df[&#39;Color&#39;], df[&#39;Season&#39;])
stats.chi2_contingency(observed=result)</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/f5f5a81e-2009-4a42-b552-7d1acc00c900/image.png" alt=""></p>
<hr>
<h3 id="필수-4-머신러닝1">필수 4. 머신러닝1</h3>
<ul>
<li><strong>아래와 같은 데이터가 있다고 가정하겠습니다.데이터를 바탕으로 선형 회귀 모델을 훈련시키고, 회귀식을 작성해주세요.</strong><ul>
<li>독립 변수(X): 광고예산 (단위: 만원)</li>
<li>종속 변수(Y): 일일 매출 (단위: 만원)</li>
<li>X=[10, 20, 30, 40, 60, 100]</li>
<li>Y=[50, 60, 70, 80, 90, 120]</li>
</ul>
</li>
<li><strong>회귀식을통해, 새로운 광고예산이 1,000만원일 경우의 매출을 예측(계산)해주세요.</strong></li>
</ul>
<p><strong>✍나의 답</strong></p>
<pre><code class="language-python">import numpy as np
from sklearn.linear_model import LinearRegression

#데이터 정의
X = np.array([10, 20, 30, 40, 60, 100])
y = np.array([50, 60, 70, 80, 90, 120])

# 1차원 -&gt; 2차원 변경
X = X.reshape(-1, 1)

# 단순선형회귀 모델 선언
model = LinearRegression()

# 모델 학습
model.fit(X, y)

# 회귀 계수와 절편
W = model.coef_  # 회귀 계수
b = model.intercept_  # 절편

# 새로운 광고 예산
ad = 1000  

# 회귀식을 사용하여 예측
predict = W * ad + b

print(W)
print(b)
print(f&quot;예상 매출 : {predict}&quot;)</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/744339f8-551f-449a-98ef-4e86b39031c5/image.png" alt="">
<strong>✍튜터님 답</strong></p>
<pre><code class="language-python">from sklearn.linear_model import LinearRegression

# 데이터
X = np.array([10, 20, 30, 40, 60, 100]).reshape(-1, 1)
Y = np.array([50, 60, 70, 80, 90, 120])

# 모델 훈련
model = LinearRegression()
model.fit(X, Y)
# 회귀식
coef, intercept = model.coef_[0], model.intercept_
print(f&quot;회귀식: Y = {coef:.2f}X + {intercept:.2f}&quot;)

# 예측
predicted_sales = model.predict(np.array([[1000]]))
print(f&quot;1000만원 광고비일 때 예상 매출: {predicted_sales[0]:.2f}만원&quot;)</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/808dc4be-f098-48c4-b25b-4f1978e3ff7e/image.png" alt=""></p>
<hr>
<h3 id="도전-1-머신러닝2">도전 1. 머신러닝2</h3>
<ul>
<li><strong>Review Rating, Age, Previous Purchases 컬럼을 활용하여, 고객이 할인(Discount Applied)을 받을지 예측하는 RandomForest모델을 학습시켜 주세요. 그리고 모델 정확도를 계산해주세요.</strong><ul>
<li>y(종속변수)는 Yes/No 로 기재된 이진형 데이터입니다. 따라서, 인코딩 작업이 필요합니다. 구현을 위해 LabelEncoder를 사용해주세요.</li>
<li>머신러닝시, 전체 데이터셋을 Train set과 Test set 으로 나눠주세요. 해당 문제에서는Test set비중을 30%로 설정해주세요. random_state는 42로 설정해주세요.<ul>
<li>Train Set: 모델을 학습하는데 사용하는 데이터셋</li>
<li>Test Set: 적합된 모델의 성능을 평가하는데 사용하는 데이터셋</li>
<li>RandomForestClassifier 를 활용하여 모델 학습을 진행해주세요. random_state는 42로 설정해주세요.</li>
<li>참고) <a href="https://www.ibm.com/kr-ko/topics/random-forest">https://www.ibm.com/kr-ko/topics/random-forest</a></li>
</ul>
</li>
</ul>
</li>
</ul>
<p><strong>✍나의 답</strong></p>
<pre><code class="language-python">from sklearn.ensemble import RandomForestClassifier
from sklearn.preprocessing import LabelEncoder
from sklearn.metrics import accuracy_score
from sklearn.model_selection import train_test_split

#라벨인코딩
le = LabelEncoder()
df[&#39;Discount Applied&#39;] = le.fit_transform(df[&#39;Discount Applied&#39;]) 

#데이터 정의
X = df[[&#39;Review Rating&#39;, &#39;Age&#39;, &#39;Previous Purchases&#39;]]
y = df[&#39;Discount Applied&#39;]  

# 학습 데이터와 테스트 데이터 분리
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)

# 랜덤포레스트 모델 선언
rf_model = RandomForestClassifier(random_state=42)

#모델 학습
rf_model.fit(X_train, y_train) 

# 예측 및 정확도 계산
accuracy = rf_model.score(X_test, y_test)

print(f&quot;모델 정확도: {accuracy:.2f}&quot;)

# 모델 정확도 확인하는 다른 방법
# y_pred = rf_model.predict(X_test)
# accuracy = accuracy_score(y_test, y_pred)</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/d81d56bb-6ef0-4fad-adaf-dd9d9fd32178/image.png" alt=""></p>
<p><strong>✍튜터님 답</strong></p>
<pre><code class="language-python">from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import LabelEncoder

# 데이터 준비
X = df[[&#39;Review Rating&#39;, &#39;Age&#39;, &#39;Previous Purchases&#39;]]
y = LabelEncoder().fit_transform(df[&#39;Discount Applied&#39;])

# 데이터 분할
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)

# 모델 학습
rf_model = RandomForestClassifier(random_state=42)
rf_model.fit(X_train, y_train)

# 예측
accuracy = rf_model.score(X_test, y_test)
print(f&quot;모델 정확도: {accuracy:.2f}&quot;)</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/d81d56bb-6ef0-4fad-adaf-dd9d9fd32178/image.png" alt=""></p>
<hr>
<h3 id="도전-2-머신러닝3">도전 2. 머신러닝3</h3>
<ul>
<li><strong>Subscription Status 컬럼을 종속변수로 사용하여 고객의 이탈 여부를 예측하는 로지스틱 회귀 모델 학습을 진행해주세요. Age, Purchase Amount, Review Rating을 활용하여 모델을 훈련한 후, 연령 30세, 구매 금액 50 USD, 리뷰 평점 4.0인 고객의 이탈 확률을 계산해주세요.</strong><ul>
<li>y(종속변수)는 Yes/No 로 기재된 이진형 데이터입니다. 따라서, 인코딩 작업이 필요합니다. 구현을 위해 LabelEncoder를 사용해주세요.</li>
<li>머신러닝시, 전체 데이터셋을 Train set과 Test set 으로 나눠주세요. 해당 문제에서는Test set비중을 30%로 설정해주세요. random_state는 42로 설정해주세요.<ul>
<li>Train Set: 모델을 학습하는데 사용하는 데이터셋</li>
<li>Test Set: 적합된 모델의 성능을 평가하는데 사용하는 데이터셋</li>
</ul>
</li>
<li>연령 30세, 구매 금액 50 USD, 리뷰 평점 4.0 인 고객을 new_customer 라는 변수에 지정해주세요. 1차원이 아닌 이중 대괄호<code>[[...]]</code>로 지정해주세요. (모델 입력 형식은 2차원 배열이어야 하므로)</li>
<li>model.predict_proba 를 사용하여 이탈 확률을 구해주세요.<ul>
<li>predict_proba의 반환값<strong>:</strong> 모델이 각 클래스에 속할 확률을 계산합니다. 결과는 다음과 같은 배열로 반환됩니다.</li>
<li>[[P(클래스 0), P(클래스 1)]]</li>
<li>P(클래스 0): 이 고객이 이탈하지 않을 확률.</li>
<li>P(클래스 1): 이 고객이 이탈할 확률.</li>
</ul>
</li>
</ul>
</li>
</ul>
<p><strong>✍나의 답</strong></p>
<pre><code class="language-python">from sklearn.linear_model import LogisticRegression
from sklearn.preprocessing import LabelEncoder
from sklearn.model_selection import train_test_split

#라벨인코딩
le = LabelEncoder()
df[&#39;Subscription Status&#39;] = le.fit_transform(df[&#39;Subscription Status&#39;]) 

#데이터 정의
X = df[[&#39;Age&#39;, &#39;Purchase Amount (USD)&#39;, &#39;Review Rating&#39;]]
y = df[&#39;Subscription Status&#39;]  


# 학습 데이터와 테스트 데이터 분리
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)

# 로지스틱회귀 모델 선언
Log_model=LogisticRegression()

# 모델 학습
Log_model.fit(X_train, y_train)

# 고객에 대한 변수 지정
new_customer = pd.DataFrame([[30,50,4.0]])

# 이탈확률 구하기
predict_customer = Log_model.predict_proba(new_customer)

prob1 = predict_customer[0][0]
prob2 = predict_customer[0][1]

print(f&quot;{prob1:.2f}: 고객이 이탈하지 않을 확률입니다.&quot;)
print(f&quot;{prob2:.2f}: 고객이 이탈할 확률입니다.&quot;)</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/728fb38d-6527-4522-8c23-74d626f81483/image.png" alt=""></p>
<p><strong>✍튜터님 답</strong></p>
<pre><code class="language-python">from sklearn.model_selection import train_test_split
from sklearn.linear_model import LogisticRegression
from sklearn.preprocessing import LabelEncoder

# 데이터 준비
X = df[[&#39;Age&#39;, &#39;Purchase Amount (USD)&#39;, &#39;Review Rating&#39;]]
y = LabelEncoder().fit_transform(df[&#39;Subscription Status&#39;])

# 데이터 분할
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)

# 모델 학습
model = LogisticRegression()
model.fit(X_train, y_train)

# 새로운 데이터 예측
new_customer = [[30, 50, 4.0]]
predicted_prob = model.predict_proba(new_customer)[0, 1]

print(f&quot;연령 30세, 구매 금액 50, 리뷰 평점 4.0인 고객의 이탈 확률: {predicted_prob:.4f}&quot;)</code></pre>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/ade9986a-f463-4130-8405-99b15b4fbfaf/image.png" alt=""></p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[태블로] 차원(Dimension)과 측정값(Measure)]]></title>
            <link>https://velog.io/@hey_min_37/%ED%83%9C%EB%B8%94%EB%A1%9C-%EC%B0%A8%EC%9B%90Dimension%EA%B3%BC-%EC%B8%A1%EC%A0%95%EA%B0%92Measure</link>
            <guid>https://velog.io/@hey_min_37/%ED%83%9C%EB%B8%94%EB%A1%9C-%EC%B0%A8%EC%9B%90Dimension%EA%B3%BC-%EC%B8%A1%EC%A0%95%EA%B0%92Measure</guid>
            <pubDate>Wed, 11 Dec 2024 12:52:29 GMT</pubDate>
            <description><![CDATA[<h2 id="dimension과-measure의-뜻과-차이">Dimension과 Measure의 뜻과 차이</h2>
<p>태블로(Tableau)와 같은 데이터 시각화 도구에서 <strong>Dimension(차원)</strong>과 <strong>Measure(측정값)</strong>는 데이터를 분석하고 시각화할 때 핵심적으로 사용되는 두 가지 데이터 유형입니다.</p>
<hr>
<h2 id="dimension-차원">Dimension (차원)</h2>
<p><strong>의미</strong></p>
<ul>
<li>데이터를 그룹화하고 분류하는 데 사용되는 필드 </li>
<li>주로 텍스트 또는 범주형 데이터를 포함</li>
<li>데이터의 &quot;질적&quot; 특성을 나타내며, 데이터를 구분하는 기준이 됩니다.</li>
</ul>
<p><strong>예시</strong></p>
<ul>
<li>고객 이름, 제품 카테고리, 지역, 날짜 등이 Dimension의 대표적인 예입니다.</li>
<li>예: &quot;고객별 판매액&quot;에서 고객 이름은 Dimension입니다.</li>
</ul>
<p><strong>특징</strong></p>
<ol>
<li>범주형 데이터</li>
</ol>
<ul>
<li>값이 정해져 있고 반복되는 데이터(예: &quot;A 지역&quot;, &quot;B 지역&quot;).</li>
</ul>
<ol start="2">
<li>축 역할</li>
</ol>
<ul>
<li>시각화에서 Dimension은 데이터의 축(X축, Y축) 또는 필터로 자주 사용됩니다.</li>
</ul>
<ol start="3">
<li>그룹화 가능</li>
</ol>
<ul>
<li>데이터를 세분화하거나 묶어 결과를 분석할 수 있습니다.</li>
</ul>
<hr>
<h2 id="measure-측정값">Measure (측정값)</h2>
<p><strong>의미</strong></p>
<ul>
<li>숫자로 측정할 수 있는 데이터를 포함하며, 수학적 계산이 가능한 필드.</li>
<li>데이터의 &quot;양적&quot; 특성을 나타냅니다.</li>
<li><em>예시*</em></li>
<li><strong>판매액(Sales), 이익(Profit), 수량(Quantity)</strong>, 평균 매출 등이 Measure에 속합니다.</li>
<li>예: &quot;고객별 판매액&quot;에서 판매액은 Measure입니다.</li>
<li><em>특징*</em></li>
</ul>
<ol>
<li>연속형 데이터</li>
</ol>
<ul>
<li>값이 연속적으로 증가하거나 감소하는 데이터(예: 100, 200, 300).</li>
</ul>
<ol start="2">
<li>집계 가능</li>
</ol>
<ul>
<li>Measure는 합계(SUM), 평균(AVG), 최소값(MIN), 최대값(MAX) 등으로 집계됩니다.</li>
</ul>
<ol start="3">
<li>계산 가능</li>
</ol>
<ul>
<li>Measure는 계산된 필드 또는 LOD 표현식에서 사용됩니다.</li>
</ul>
<hr>
<h2 id="dimension과-measure의-차이점">Dimension과 Measure의 차이점</h2>
<table>
<thead>
<tr>
<th><strong>특성</strong></th>
<th><strong>Dimension (차원)</strong></th>
<th><strong>Measure (측정값)</strong></th>
</tr>
</thead>
<tbody><tr>
<td><strong>데이터 유형</strong></td>
<td>텍스트, 날짜, 범주형 데이터</td>
<td>숫자형 데이터</td>
</tr>
<tr>
<td><strong>주요 기능</strong></td>
<td>데이터를 분류하고 그룹화</td>
<td>데이터를 계산하고 집계</td>
</tr>
<tr>
<td><strong>시각화 역할</strong></td>
<td>축(X, Y), 색상, 필터로 사용</td>
<td>바, 선, 크기 등으로 값 시각화</td>
</tr>
<tr>
<td><strong>집계 여부</strong></td>
<td>집계되지 않음</td>
<td>집계 가능 (SUM, AVG, COUNT 등)</td>
</tr>
<tr>
<td><strong>예시</strong></td>
<td>지역, 제품 카테고리, 고객 이름</td>
<td>판매액, 수익, 수량</td>
</tr>
</tbody></table>
<hr>
<h2 id="dimension과-measure의-상호작용">Dimension과 Measure의 상호작용</h2>
<p>Dimension과 Measure는 함께 사용되어 강력한 분석을 가능하게 합니다. <strong>예를 들어</strong>:</p>
<ul>
<li>Dimension을 기준으로 데이터를 구분: &quot;카테고리별&quot; 또는 &quot;지역별&quot;.</li>
<li>Measure를 통해 숫자 데이터의 크기나 변화를 분석: &quot;총 판매액&quot; 또는 &quot;평균 이익&quot;</li>
<li><em>예시*</em>
&quot;지역별 총 판매액&quot;을 분석한다면:</li>
<li>Dimension: 지역(Region)</li>
<li>Measure: 판매액(Sales)</li>
</ul>
<hr>
<h2 id="dimension과-measure-변환">Dimension과 Measure 변환</h2>
<p>태블로에서 Dimension과 Measure는 필요에 따라 서로 변환 가능합니다.</p>
<ul>
<li>Measure를 Dimension으로 변환: 숫자 필드를 범주형 데이터로 사용하고 싶을 때</li>
<li>Dimension을 Measure로 변환: 특정 카테고리를 숫자로 집계하고 싶을 때</li>
</ul>
<p><strong>이해를 돕는 비유</strong>
Dimension: 데이터를 분류하는 책장의 &quot;칸&quot; (예: 지역별 책장).
Measure: 각 칸에 쌓인 &quot;책의 두께&quot; (예: 해당 지역의 판매 총액).</p>
]]></description>
        </item>
        <item>
            <title><![CDATA[[태블로] LOD 표현식]]></title>
            <link>https://velog.io/@hey_min_37/%ED%83%9C%EB%B8%94%EB%A1%9C-LOD-%ED%91%9C%ED%98%84%EC%8B%9D</link>
            <guid>https://velog.io/@hey_min_37/%ED%83%9C%EB%B8%94%EB%A1%9C-LOD-%ED%91%9C%ED%98%84%EC%8B%9D</guid>
            <pubDate>Wed, 11 Dec 2024 12:39:18 GMT</pubDate>
            <description><![CDATA[<h2 id="lod-표현식">LOD 표현식</h2>
<p>LOD(Level of Detail) 표현식은 태블로에서 데이터 집계의 범위를 세부적으로 제어할 수 있는 도구 입니다. 이는 특정 차원에 독립적이거나 종속적인 집계값을 생성할 때 유용합니다.</p>
<hr>
<h2 id="lod-표현식의-주요-유형">LOD 표현식의 주요 유형</h2>
<p><strong>INCLUDE</strong>
추가적인 차원을 포함하여 집계를 수행합니다.
데이터 세트에서 현재 뷰의 차원 외에 더 많은 세부사항을 포함하고 싶을 때 사용합니다.</p>
<pre><code>문법: { INCLUDE [Dimension] : SUM([Measure]) }</code></pre><p>예시: 각 주문별 판매액을 집계할 때, 지역별 총 판매액도 계산하고 싶은 경우.</p>
<p><strong>EXCLUDE</strong>
특정 차원을 제외하여 집계를 수행합니다.
뷰에서 차원을 제거하고 더 높은 수준의 집계를 계산하고 싶을 때 유용합니다.</p>
<pre><code>문법: { EXCLUDE [Dimension] : AVG([Measure]) }</code></pre><p>예시: 지역별로 데이터를 보고 있지만, 지역 차원을 제외한 전체 평균 판매액을 계산하는 경우.</p>
<p><strong>FIXED</strong>
고정된 차원 수준에서 집계를 수행합니다.
특정 차원(뷰와 무관한)에 고정된 값을 계산할 때 사용합니다.</p>
<pre><code>문법: { FIXED [Dimension] : MAX([Measure]) }</code></pre><p>예시: 고객별로 고정된 총 구매 금액을 계산하는 경우.</p>
<hr>
<h2 id="lod-표현식의-특징">LOD 표현식의 특징</h2>
<ul>
<li><strong>뷰 차원과의 독립성</strong>: FIXED는 현재 뷰와 상관없이 고정된 차원을 기준으로 값을 계산하며, INCLUDE와 EXCLUDE는 뷰에 종속적입니다.</li>
<li><strong>집계 가능성</strong>: LOD 표현식은 일반적으로 다른 집계와 결합하여 사용할 수 있습니다.</li>
<li><strong>성능 고려</strong>: FIXED는 계산 과정에서 더 많은 리소스를 사용할 수 있으므로 필요할 때만 사용해야 합니다.</li>
</ul>
<hr>
<h2 id="lod-표현식의-활용-예시">LOD 표현식의 활용 예시</h2>
<p><strong>고객별 총 판매액 계산 (FIXED)</strong></p>
<pre><code>{ FIXED [Customer Name] : SUM([Sales]) }</code></pre><p>모든 고객의 개별 판매액을 계산합니다.</p>
<p><strong>지역별로 세부 항목 포함하여 평균 판매액 계산 (INCLUDE)</strong></p>
<pre><code>{ INCLUDE [Region] : AVG([Sales]) }</code></pre><p>지역별로 세부 데이터를 포함한 평균 값을 계산합니다.</p>
<p><strong>카테고리를 제외한 전체 판매 평균 (EXCLUDE)</strong></p>
<pre><code>{ EXCLUDE [Category] : AVG([Sales]) }
카테고리 차원을 제외한 전체 평균 판매액을 계산합니다.</code></pre><hr>
<h2 id="lod-표현식-사용-시-주의사항">LOD 표현식 사용 시 주의사항</h2>
<p><strong>1. 뷰 필터와의 관계</strong></p>
<ul>
<li>FIXED는 뷰 필터에 영향을 받지 않으므로, 필터를 적용해도 고정된 값을 반환합니다.</li>
<li>반면 INCLUDE와 EXCLUDE는 <strong>뷰 필터</strong>의 영향을 받습니다.</li>
</ul>
<p><strong>2. 성능 고려</strong></p>
<ul>
<li>LOD 표현식이 복잡하거나 큰 데이터 세트에서 사용되면 성능이 저하될 수 있습니다. 필요한 최소 수준으로 설계하세요.</li>
</ul>
<p><strong>3. 계산의 의미 파악</strong></p>
<ul>
<li>LOD를 사용할 때 결과값이 어떤 차원 수준에서 집계되는지 항상 이해해야 합니다.</li>
</ul>
<h2 id="lod-표현식과-집계-차이">LOD 표현식과 집계 차이</h2>
<ul>
<li>일반 집계(Aggregate)는 현재 뷰의 차원에 종속적입니다.</li>
<li>LOD 표현식은 사용자가 원하는 수준에서 데이터를 제어할 수 있어 유연성이 높습니다.</li>
</ul>
]]></description>
        </item>
        <item>
            <title><![CDATA[[태블로] 실습으로 배우는 태블로]]></title>
            <link>https://velog.io/@hey_min_37/%ED%83%9C%EB%B8%94%EB%A1%9C-%EC%8B%A4%EC%8A%B5%EC%9C%BC%EB%A1%9C-%EB%B0%B0%EC%9A%B0%EB%8A%94-%ED%83%9C%EB%B8%94%EB%A1%9C</link>
            <guid>https://velog.io/@hey_min_37/%ED%83%9C%EB%B8%94%EB%A1%9C-%EC%8B%A4%EC%8A%B5%EC%9C%BC%EB%A1%9C-%EB%B0%B0%EC%9A%B0%EB%8A%94-%ED%83%9C%EB%B8%94%EB%A1%9C</guid>
            <pubDate>Tue, 10 Dec 2024 13:22:19 GMT</pubDate>
            <description><![CDATA[<h2 id="태블로-차트-소개">태블로 차트 소개</h2>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/c826e56b-acba-4a10-83c2-dbe4e41c1d67/image.png" alt=""></p>
<h3 id="표현방식">표현방식</h3>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/fa37f1a9-a095-4fe0-b018-ee075b1a6cbf/image.png" alt=""></p>
<p>Tableau 표현 방식 기능은 데이터에 적합한 대표적으로 24개의 그래프를 이용할 수 있다.</p>
<h2 id="기본-그래프">기본 그래프</h2>
<h3 id="1-선-그래프line-plot">1. 선 그래프(Line Plot)</h3>
<p><strong>특징</strong></p>
<ul>
<li>간단하고 사용하기 쉽습니다.</li>
<li>시계열 데이터(시간에 따른 추이)를 시각화할 경우, 변화량과 트렌드를 한눈에 보기에 용이합니다.</li>
<li>연속적인 데이터에 사용하기 적합합니다. 연속형 데이터는 온도(25도, 30도), 시간(시, 분, 초)를 말합니다.<pre><code>[실습] 에어비앤비 호스트 수 추이 
연도별(2008-2016년) 에어비앤비 호스트 수 증가 추이를 선 그래프로 시각화해봅시다!
</code></pre></li>
</ul>
<p>📍 요구 사항
✅ 열: Host Since(년)
✅ 행: 카운트(고유)(Host Id)
✅ 마크 레이블: 표시
✅ 색상: 그래프의 색상을 자유롭게 변경해주세요.
✅ 경로: 라인 패턴 유형을 2번째 선(--)으로 변경해주세요.</p>
<pre><code>
![](https://velog.velcdn.com/images/hey_min_37/post/cb91a9bc-debd-4117-adf4-bfd6d912c627/image.png)

### 2. 막대 그래프(Bar Plot)
**특징**

- 간단하고 사용하기 쉽습니다.
- 범주 간의 차이나 분포를 시각적으로 이해하기 쉽습니다.
- 범주형 데이터(성별, 혈액형, 이름 등)에 사용하기 적합합니다.</code></pre><p>[실습] 동네별 숙소 평균 가격
어느 동네가 숙소 평균 가격이 높을까요? 
neighborhood_cleansed별 평균 가격을 막대 그래프로 시각화 해봅시다!</p>
<p>📍 요구 사항
✅ 색상: 그래프의 색상과 테두리 색상을 자유롭게 변경해주세요.
✅ 정렬: 필드 평균(Price) 내림차순 기준 정렬
✅ 화면 맞춤: 높이 맞추기</p>
<pre><code>
![](https://velog.velcdn.com/images/hey_min_37/post/13a63834-106a-42df-940e-485cdf8f89ea/image.png)

### 3. 맵 차트(Map Chart)
**특징**

- 지도를 활용해서 지리적 위치를 살펴볼 수 있습니다.
- 각 지역별 데이터의 분포 및 비중을 한눈에 확인할때 주로 사용합니다.</code></pre><p>[실습] zipcode별 숙소 리뷰 평균 평점 분포
보스턴 지역에서 어느 구역이 숙소 리뷰 평균 평점이 가장 높을까요? 
평균 평점 분포를 맵 차트로 시각화 해봅시다!</p>
<p>📍 요구 사항
✅ 세부정보: Zipcode
✅ 색상: 평균(Review Scores), 색상은 자유롭게 변경해주세요.
✅ 레이블</p>
<ul>
<li>Neighbourhood Cleansed: 폰트 볼드 처리, 폰트 크기(10pt)</li>
<li>평균(Review Scores)
✅ 백그라운드 레이어:투명도 100%
✅ 도구 설명</li>
<li>도구 설명 표시: 마우스 오버</li>
</ul>
<pre><code>![](https://velog.velcdn.com/images/hey_min_37/post/77b1bbd3-e4ed-49f8-8fb0-dfdeeefe68b2/image.png)

### 4. 파이 차트(Pie Chart)
**특징**

- 각 부분의 크기가 상대적인 비율이기 때문에 각 부분이 전체에서 차지하는 비중을 쉽게 이해할 수 있습니다.
- 데이터의 구성 비율과 분포를 한눈에 파악할 수 있습니다.
- 다양한 변수를 다루기에는 적합하지 않을 수 있습니다. 변수가 적을 때 직관적으로 사용하기 용이합니다.</code></pre><p>[실습] 룸 타입별 비중
어떤 룸 타입이 가장 많은 비중을 차지하고 있을까요? 
파이차트로 시각화 해봅시다!</p>
<p>📍 요구 사항
✅ 색상: Room Type 색상표에서 연한 번개를 선택해주세요.
✅ 각도: 카운트(고유)(Id)의 퀵테이블 구성 비율
✅ 측정값: 카운트(고유)(Id)
✅ 레이블: Room Type, 측정값을 순서대로 표시해주세요.</p>
<ul>
<li>Room Type: 폰트 볼드 처리, 폰트 크기(12pt), 사용자 지정 색상(#4B89DC)</li>
<li>측정값: 폰트 볼드 처리, 폰트 크기(10pt)
✅ 화면 맞춤: 전체 보기<pre><code>![](https://velog.velcdn.com/images/hey_min_37/post/a659d5b4-9ff5-49f1-98d1-09f16d540ccd/image.png)
</code></pre></li>
</ul>
<h3 id="5-트리맵-차트treemap-chart">5. 트리맵 차트(Treemap Chart)</h3>
<p><strong>특징</strong></p>
<ul>
<li>데이터를 계층적으로 표현하는데 사용됩니다.</li>
<li>카테고리별로 특정 데이터 집합이 전체 데이터에서 차지하는 비율을 면적으로 표현하여 카테고리별 구성 요소를 한눈에 파악할 수 있어요.<pre><code>[실습] 가장 많이 리스트된 호스트 이름 
가장 많이 리스트된 호스트는 누구일까요? 
호스트의 숙소의 평균 가격과 숙소 가격 합계가 궁금해요. 
숙소 가격 합계가 큰 순서대로 색상을 나타내주세요. 
트리맵 차트로 시각화 해봅시다!
</code></pre></li>
</ul>
<p>📍 요구 사항
✅ 열: 합계(Host Listings Count)
✅ 행: Host Name
✅ 레이블: Host Name, 평균(Price)
✅ 색상: 합계(Price), 색상 파란색-녹색 단일</p>
<pre><code>![](https://velog.velcdn.com/images/hey_min_37/post/0fa3b2e9-5ed9-48d2-8672-16118f2c9580/image.png)


### 6. 스택 플랏(Stacked Plot)</code></pre><p>[실습] 일반 호스트와 슈퍼 호스트의 응답 시간별 비중 비교
일반 호스트와 슈퍼 호스트의 응답 시간 비중은 어떻게 다를까요? 
Host Response Time별(1시간내 응답, 몇시간내 응답 등) 슈퍼 호스트와 일반 호스트 수를 
단순 누적 그래프로 시각화 해봅시다!</p>
<p>📍 요구 사항
✅ 색상: 슈퍼 호스트와 일반 호스트 수의 색상을 다르게 표현해주세요. 
색상표에서 여름을 선택해주세요.
✅ 레이블: 마크 레이블 표시
✅ 축: 행 머리글 숨기기
✅ 범례: 표시
✅ 화면 맞춤: 너비 맞추기</p>
<pre><code>![](https://velog.velcdn.com/images/hey_min_37/post/21f9a0ac-b363-421e-9136-93cbe603cb76/image.png)

## 데이터 분석 그래프
#### 1. 박스 플랏(Box Plot)
데이터의 분포와 이상치(outlier)를 시각적으로 파악할때 사용하는 그래프입니다.</code></pre><p>[실습] 숙박 시설 유형별 가격 분포
property type(숙박 시설 유형)은 주택(House), 게스트 하우스(Guesthouse), 
빌라(Villa) 등이 있어요. 
property type별 가격 분포를 박스 플랏으로 시각화해봅시다!</p>
<p>📍 요구 사항
✅ 색상: 자유롭게 변경해주세요.
✅ 마크: 모양으로 변경해주세요.
✅ 축 편집: y축의 주 눈금선을 고정으로 변경해주세요.
✅ 화면 맞춤: 전체 보기</p>
<pre><code>![](https://velog.velcdn.com/images/hey_min_37/post/2e81a06f-b04a-47cc-93bf-e8ef19b717e2/image.png)

#### 2. 파레토 차트(Pareto Chart)
📍 파레토 법칙이란?
전체 결과의 80%가 전체 원인의 20%에서 일어난다는 마케팅 기법
(다수의 결과는 소수의 원인에 의해 생겨난다)
![](https://velog.velcdn.com/images/hey_min_37/post/b2799a75-8e0b-4a55-bece-da1eb9048a28/image.png)

#### 3. 상관 관계(Scatter Plot)
지표간 어떤 선형적인 관계가 있는지 알아보기 위해 상관 분석을 자주 활용합니다.
![](https://velog.velcdn.com/images/hey_min_37/post/c960500b-bbc7-4046-98ad-72c1ba3f9e34/image.png)

#### 4. 시계열 예측
태블로에서 지수 평활법(exponential smoothing)을 활용해서 예측 모델링을 합니다. 과거 데이터에 기반하여 미래를 예측하는 시계열 예측을 합니다.</code></pre><p>[실습] 일별 에어비앤비 매출 예측하기
calender.csv는 2016/9/6부터 2017/9/4까지 일별 전체 매출 실적 데이터입니다. 
실제 값을 바탕으로 2017/9/5 - 2017/9/16 매출을 예측해봅시다!</p>
<p>📍 요구 사항
✅ 표현 방식: 라인 그래프
✅ 예측: 예측 표시
✅ 색상: 색상표에서 천사의 돌을 선택해주세요.
✅ 레이블: 선 끝 레이블 지정
✅ 범례: 숨기기
✅ 워크시트 서식: 채우기 색상을 자유롭게 변경해주세요.</p>
<p>```
<img src="https://velog.velcdn.com/images/hey_min_37/post/2cf96db5-4e6b-4308-a95a-b7bf7e9859d8/image.png" alt=""></p>
<h2 id="그-외의-그래프">그 외의 그래프</h2>
<h4 id="1-1-도넛-차트donut-chart">1-1. 도넛 차트(Donut Chart)</h4>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/f2c324e3-5454-4a3f-94c7-e5295bfc7b94/image.png" alt=""></p>
<p><strong>특징</strong></p>
<ul>
<li>파이 차트와 비슷한 형태로 가운데 구멍이 뚫린 경우를 도넛 차트라고 불립니다.</li>
<li>각 부분의 크기가 상대적인 비율이기 때문에 각 부분이 전체에서 차지하는 비중을 쉽게 이해할 수 있습니다.</li>
<li>태블로에서는 대시보드의 KPI 카드로 많이 활용됩니다.</li>
</ul>
<h4 id="1-2-히트맵-차트heatmap-chart">1-2. 히트맵 차트(Heatmap Chart)</h4>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/e17ca3a3-e8c9-460a-9bf5-7eec43262277/image.png" alt="">
<strong>특징</strong></p>
<ul>
<li>색상을 활용해서 데이터 값을 시각적으로 강조할 수 있어요. 색상의 그라데이션을 통해 측정값들을 한눈에 비교할 수 있습니다.</li>
<li>태블로에서 하이라이트 테이블이라고도 불립니다.</li>
</ul>
<h4 id="1-3-영역-차트area-chart">1-3. 영역 차트(Area Chart)</h4>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/b149d21c-2070-4443-8080-a87feb1c1439/image.png" alt="">
<strong>특징</strong></p>
<ul>
<li>영역 차트는 선 아래 영역을 색으로 채워서 데이터의 영역 크기를 파악할 수 있어요.</li>
<li>시간에 따른 데이터의 추이를 시각적으로 나타냅니다. 데이터의 변화 및 흐름을 쉽게 파악할 수 있습니다.</li>
</ul>
<h2 id="시각화-level-up">시각화 level up!</h2>
<h4 id="1-1-이중-축콤보-차트">1-1. 이중 축(콤보 차트)</h4>
<p><img src="https://velog.velcdn.com/images/hey_min_37/post/34d42faf-2b05-4429-9a4a-6d7c97159192/image.png" alt="">
<strong>특징</strong></p>
<ul>
<li>이중 축 차트를 사용하면 두 가지 서로 다른 데이터 집합을 한번에 비교할 수 있어요.</li>
<li>축에 서로 다른 단위나 기준을 가지고 있는 경우, 그래프를 볼때 한눈에 알아보기 어렵습니다.<h4 id="1-2-평균선참조선">1-2. 평균선/참조선</h4>
<img src="https://velog.velcdn.com/images/hey_min_37/post/e3b741b8-b443-492f-a886-f4df8b83dc9d/image.png" alt=""></li>
<li>분석 패널에서 평균선 라인/상수 라인/참조선을 추가해서 의사결정을 빠르게 할 수 있습니다.</li>
</ul>
]]></description>
        </item>
        <item>
            <title><![CDATA[[머신러닝] 머신러닝 특강 - 군집분석]]></title>
            <link>https://velog.io/@hey_min_37/%EB%A8%B8%EC%8B%A0%EB%9F%AC%EB%8B%9D-%EB%A8%B8%EC%8B%A0%EB%9F%AC%EB%8B%9D-%ED%8A%B9%EA%B0%95-%EA%B5%B0%EC%A7%91%EB%B6%84%EC%84%9D</link>
            <guid>https://velog.io/@hey_min_37/%EB%A8%B8%EC%8B%A0%EB%9F%AC%EB%8B%9D-%EB%A8%B8%EC%8B%A0%EB%9F%AC%EB%8B%9D-%ED%8A%B9%EA%B0%95-%EA%B5%B0%EC%A7%91%EB%B6%84%EC%84%9D</guid>
            <pubDate>Thu, 28 Nov 2024 13:28:54 GMT</pubDate>
            <description><![CDATA[<p>데이터 사이의 유사성을 기준으로 그룹을 나누는 과정인 <strong>군집분석, 클러스터링(Clustering)</strong>에 대해 알아 보려고합니다.</p>
<h3 id="01-클러스터링이란">01. 클러스터링이란?</h3>
<p>이 강의의 목표는?
클러스터링 개념 제대로 알기: 데이터를 그룹으로 묶는 게 왜 중요한지 이해해요!
전처리 → 모델링 → 인사이트 도출까지 프로세스 따라가기.
실습을 통해 진짜 현업에서 쓰는 코드 습득!
클러스터링? 한 마디로 요약하자면!
데이터 안의 숨겨진 패턴을 찾아 그룹으로 나누는 마법! 🪄</p>
<p>데이터 특징 기반으로 군집(Cluster) 형성.
각 군집에서 의미 있는 인사이트를 뽑아내는 게 핵심.
진행 과정은 이렇게!
데이터 준비 🛠️</p>
<p>이상치 제거: Z-Score, IQR 등 활용해 튀는 데이터를 쏙 빼요.
표준화 작업: 데이터 크기 차이를 조정해요. (MinMax Scaling, Standard Scaling)
PCA로 차원 축소까지 깔끔하게!
알고리즘 적용 🤖</p>
<p>가장 많이 쓰는 K-means부터 복잡한 데이터에 강한 DBScan까지 배워요.
클러스터 품질은 실루엣 분석이나 elbow method로 확인!
결과 분석 및 시각화 📊</p>
<p>2D와 3D 시각화로 군집이 잘 나뉘었는지 확인해요.
군집별 특징 정리하고 인사이트 도출!
실습 맛보기
python
코드 복사
from sklearn.cluster import KMeans
kmeans = KMeans(n_clusters=5, random_state=42)
kmeans.fit(data)
Python 코드로 바로 실행해볼 수 있도록 깔끔한 예제도 제공돼요! 😍</p>
<p>결론!
데이터 분석의 기본기를 다지고 싶다면 클러스터링은 필수.
Python으로 군집 분석 프로세스를 차근차근 익히다 보면, 데이터가 가진 숨겨진 비밀을 풀 수 있어요. 🔍
현업에서도 바로 써먹을 수 있는 기술들이라 더 유용!</p>
<p>내일수정예정</p>
]]></description>
        </item>
    </channel>
</rss>