Posts

[Day 17] Microsoft의 ML-For-Beginners - 분류 및 군집화 모델

Image
 안녕하세요! 오늘은 Day 17입니다! 오늘 카페에서 공부하려고 헤드폰을 집에 두고 가 버렸다 대신  ML-For-Beginners  다음 부분을 공부하기로 했다 4 - Classification (분류) 5 - Clustering (군집화) 초보자 위한 과정이라 새로운 것을 많이 없는데 아래 재미있는 사진으로 요약해 봤다 imblearn 라이브라리로 imbalanced 데이터를 고칠 수 있다 from imblearn.over_sampling import SMOTE 사용 후, 전 oversample = SMOTE() transformed_feature_df, transformed_label_df = oversample.fit_resample(feature_df, labels_df) 마지막으로, 오늘 어떤 음식을 먹을까란 모델로 웹사이트 만들어 봤다 재료를 선택한 후 선택한 것을 기반으로 요리 추천을 받을 것이다 그리고 군집화 모델 만들 때 좋은 시각화 코드를 받았다. 다음번에 군집화 모델 구성하면 아래 시각화 만들어야겠다 오늘 TensorFlow developer certificate 준비 시작할 수 없었는데 내일 무조건 시작하겠습니다! 오늘은 여기까지입니다! 내일 뵐게요!

[Day 16] 강화 학습 및 ML Specialization 자격증

Image
 안녕하세요! 오늘은 Day 16입니다! 오늘에 공부했던 것: DeepLearning.AI의 머신러닝 오늘 위에 course의 마지막 부분을 공부했다. 강화학습에 대해 알게 되었다. 그리고 Specialization 자격증 땄다 오늘은 강화학습에 대해 처음으로 공부해서 Andrew Ng 교수님 덕분에 굉장히 재미있었다 State - action 이란 용어 알게 되었다 Return도 강화학습에 중요한 말이다 (금융와 비슷한 역할이다) Policy는 상태(state) 알며 어느 행동을 해야 하는 말이다 discount factor에 따라 모델 impatience를 영향을 준다 Bellman equation - It is the return if you start from state s, take action a (once), then behave optimally after that. 훈련하며 행동을 어떻게 올바로 선택해야 할까? 처음엔 random 행동 선택의 확률을 높게 택하고 나서 훈련하다 조금씩 조금씩 낮추면 좋은 것 같다고 했다 마지막으로, mini-batch는 Andrew Ng 교수님이 even though there is more noise and not so reliably always head towards the minimum, it is much more computantionally inexpensive than batch learning라고 했다 내일부터 ~~~ TensorFlow Developer Certificate 준비 시작해보도록 하겠습니다 오늘 여기까지입니다! 내일 뵐게요!

[Day 15] 퀴즈 및 practical lab 도전

Image
 안녕하세요! 오늘은 Day 15입니다! 오늘 공부했던 것 Stanford Online의 Machine Learning specialization 퀴즈와 practice labs 왜냐하면 자격증 따기 위해서다 LinkedIn에서 공유할 필요없고 나중에 Specialization 자격증 따면 공유할지도 모른다 Lab 하다 신경망 모델의 lambda (정규화) 어떻게 조정할 수 있는지 알게 되었다 이 코드로 모델에 알맞은 정규화 변수를 구할 수 있다 내일, 마지막  Unsupervised Learning, Recommenders, Reinforcement Learning  강의를 끝내고 퀴즈와 practice labs도 해 봐 Machine Learning Specialization 끝낼 것이다 오늘 이상입니다! 내일 뵐게요!

[Day 14] Andrew Ng's Machine learning specialization

Image
 안녕하세요! 오늘은 Day 14입니다! 오늘 공부했던 것: 고급 학습 알고리즘 Andrew Ng의 교수법이 Yaser S. Abu-Mostafa의 교수법와 비슷하게 재미있다! 오늘에 공부했던 내용을 요약하자면 ~ 신경망에 대해 공부하고 모델 택 시 테스트 데이터를 사용 금지 말을 꼭 기억에 둬야 한다. 훈련과 검증 데이터셋을 기반으로 모델을 택해야 테스트 데이터로 모델 평가하면 된다! Bias/variance Andrew Ng은 Bias와 variance 이론 이해할 수 있는데 실제로 모델을 만들 때에만 차이가 이해할 수 있다고 한다. 앞으로 저도 모델 만들 때, bias와 variance를 고려해야 한다 신경망 모델에도 정규화의 lambda 조정할 수 있다 Random Forest random forest 모델 만들 때, n_features 하이퍼파라미터 어떻게 조정해야 하는지 모르겠는데 이 간단한 공식으로 아마 더 잘 할지도 모른다  의사결정나무 및 신경망 차이점 굉장히 재미있다. 내일 Unsupervised Learning, Recommenders, Reinforcement Learning 남았다 오늘 이상입니다! 내일 뵐게요!

[Day 13] 2024 한국 소프트웨어공학 학술대회에 참가

Image
 안녕하세요! 오늘은 Day 13입니다! 오늘의 내용: Machine Learning Specialization by Andrew Ng (Stanford University) 2024 한국 소프트웨어공학 학술대회 첫 번째, Andrew Ng의 머신러닝 강의를 보기 추천을 많이 받아서 해 보고자 한다 내용이 간다하고 교수님의 교수법을 따라하기도 쉬웠다 아직 끝내지 못 하는데, 지금까지 내용을 요약하자면 Gradient descent 위에 사진은 neural network의 cost function이다 Cost function (error) 최소화하는 데 Learning rate와 w,b 어떻게 사용하는지 너무 쉽게 설명해 준다.  이와 같은 cost function은 logistic regression이다. w,b 변경하면서 (global) minimum으로 도착할 것이다 Learning rate 이건 Andrew Ng 교수의 신경망 모델 구성 시 learning rate 값 테스트 해 보자라고 했다 Regularization (정규화) 정규화의 lambda에 따라 과적합을 최소화할 수 있다 두 번째, 이번 학기 동안 '소프트웨어품질보증및시험'에서 챗GPT와 관련이 있는 literature review 페이퍼 한번 작성했는데 우리 송지영 교수님께서 2024 한국 소프트웨어공학 학술대회에 제출할 수 있는 기회를 알려 주셔서 제출했고 오늘에 결과 나왔다  온라인 아직 읽을 수 없는데 나중에 올리면 이 글을 업데이트할 것이다 오늘 이상입니다! 내일 뵐게요!

[Day 12] 신경망 모델 및 웹앱 만든다

Image
 안녕하세요! 오늘은 Day 12입니다! 오늘 했던 것: Bank churn 대회 제출 Microsoft에서 초보 위한 튜터리얼에 따라 웹앱 만든다 어제 만들었던 SVC 모델을 제출했는데 public score은 ~   SVC 모델은 1100위를 이상 차지하고 있지만 신경망 모델 만들기로 했다 Neural network notebook 로 제출 csv를 생성했다 여러 가지 모델 구성하여 결과는 내일 top 1000 들어가기 위해 더 좋은 모델 제출할 것이다 그 다음에 ~~~  Microsoft의 ML-For-Beginner course 3강의를 공부하고 원-달러 환율 예측 모델 웹앱 만들어 봤다. 만들긴 했는데 pythonanywhere 사용해 본 적이 없어서 원하던 웹사이트 생성하기까지 시간이 좀 걸렸다. 위 모델이 며칠 전에 만들었다 ( Day 7 ) 오늘 이상입니다! 내일 뵐게요!

[Day 11] Kaggle에서 'Bank churn 예측' 대회 참가하였다

Image
 안녕하세요! 오늘은 Day 11입니다! 오늘 Bank Churn 예측 모델 구성 대회에 참가하였다 대회는  Binary Classification with a Bank Churn Dataset 나의 notebook는  Various SVM models for bank churn classification 데이터는 오늘 SVM 모델 구성하고자 했다 단순 SVM 모델 Accuracy: 0.8554246069015663 Precision: 0.7598201609086607 Recall: 0.4608208955223881 F1-Score: 0.5737001965338574 AUC-ROC: 0.7109204519856266 Confusion Matrix: [[25024  1015]  [ 3757  3211]] SVM와 RandomForestClassifier 모델 Accuracy: 0.7972854243039356 Precision: 0.5216507738002188 Recall: 0.4789035591274397 F1-Score: 0.49936401047512163 AUC-ROC: 0.6806937627427974 Confusion Matrix: [[22979  3060]  [ 3631  3337]] SVM와 KNeighborsClassifier 모델 Accuracy: 0.8378828733298997 Precision: 0.6524608712049783 Recall: 0.4965556831228473 F1-Score: 0.5639312199494744 AUC-ROC: 0.7128886177049008 Confusion Matrix: [[24196  1843]  [ 3508  3460]] 하이퍼파라미터를 튜닝시키는 SVM 모델 <<< 이건 5시간이나 결렸는데 첫 번째 모델과 비슷한 결과 나와 버렸다. 하이퍼파라미터 튜닝 잘 몾 했던 것 ...

[Day 10] 주택가격예측 모델 비교

Image
 안녕하세요! 오늘은 Day 10입니다! 20% 넘었다!  오늘 연습했던 것 House price basic prediction model comparison 오늘의 모델이 다음과 같은 데이터를 사용한다 대부분 범주형 데이터인데 pd.get_dummies으로 처리하였다 주택 사이즈 (area)와 가격에 밀접한 상관 관계가 있어서 다음 시각화를 만들었다 이상치 데이터도 있구나 처리하기 위해 z-score이나 IQR 방식을 사용하게 되었다. 그 다음에 피처 선택은 가격과 제일 밀접한 상관 관계가 있는 어떤 톱1(top10) 피처를 찾기 위해 .corr() 방식 쓰고 ```'area', 'bathrooms_2', 'airconditioning', 'stories_4', 'bedrooms_2', 'mainroad', 'prefarea', 'guestroom', 'furnishingstatus_unfurnished', 'parking_2'로 나왔다. 모델 구성은 단순 모델: LinearRegression 만든 후에 DecisionTreeRegressor, RandomForestRegressor, XGBRegressor와 비교해 봤다. 결과는: LinearRegression - Train MSE: 0.81978 | Test MSE: 1.37829 DecisionTreeRegressor - Train MSE: 1.06803 | Test MSE: 1.64172 RandomForestRegressor - Train MSE: 0.91908 | Test MSE: 1.41498 XGBRegressor - Train MSE: 0.26813 | Test MSE: 1.60890 마지막으로 PolynomialRegression 모델도 구성하여 비교해 봤는데 결과는: 뜨거운 물이 왼손 손가락에 쏟아져서 이거 빨리 쓰고 다시 찬 물에 넣을게요! 너무 ...

[Day 9] CGPA 예측 단순 선형 회귀 모델

Image
 안녕하세요! 오늘은 Day 9입니다.  Linear regression to predict student GCPA 오늘 단순한 예측 모델 구성해 봤다.  데이터는 clean이며 다음과 같다 간단한 시각화도 만들어 봤다 CGPA 高 => placement = 1 확율도 高 IQ는 상관없는 것 같다 그냥 재미로 ~ 피처는 iq와 placement, 목푯값은 cgpa로 택했다 scikit-learn의 LinearRegression()으로 R-squared은 0.69937나왔는데 statsmodel로 구성했던 모델와 비슷하다.  예상대로 iq의 중요성이 낮다. 오늘은 이상입니다. 내일 뵐게요 ^^