KT 에이블스쿨 : 딥러닝 심화 4일차 - PandasAI, ChatGPT 파인튜닝, 언어모델링(NLP), 허깅페이스

이미지
  딥러닝 심화   24.04.19 (금)  어느새 딥러닝 마지막날 ,, ㅠ  ChatGPT  - PandasAI를 실습할 유통 판매데이터  거의 모든 비즈니스는 아래의 3가지 데이터셋으로 이뤄짐 제화 : 회사가 제공하는 기업 데이터 (상품 마스터데이터 ) 고객 : 고객에 의해 생기는 고객 데이터 (고객  마스터데이터 ) 트랜젝션 데이터 (transaction) : 고객과 회사의 상호작용으로 인해 생긴 데이터 ex) 제화 = 금융상품 / 요금제+스마트폰 고객 = 가입, 구매 트랜젝션 = 구매이력 ChatGPT - 파인튜닝 ChatGPT를 파인튜닝해서 서비스로 만든 것이 많음 = OpenAI의 마켓플레이스   그중 데이터분석에 특화된 서비스가 Data Analytics 임  Data Analytics 데이터셋 엑셀파일을 올리면서, 질문하면 그래프 시각화, 상관관계 분석을 해줌 게다가 비즈니스 관점에서 해석해서 알려줌 질문이 구체적일수록 상세하게 답변해줌 = 데이터분석 상세 방법을 알아야함                                              자연어처리 NLP 자연어처리할때 !! 맥락 !!을 이해 하는게 중요함 context ~~~!!! 단순 text가 아니라, context가 중요 기존의 NLP 는 RNN 기반 오랫동안 언어모델을 위한 주요한 접근 방식 단점 : 병렬처리 어려움, 장기 의존성 문제, 확장성 제한  언어모델이 전체적인 맥락을 파악하는게 어려웠음 Transformer : 자연어처리는 이게 최고 (현재)  구글이 2017년에 만듬 (오픈AI가 2018년부터 시작) ...

KT 에이블스쿨 : 딥러닝 심화 3일차 - 라벨링, 자체 딥러닝 모델, ChatGPT API, Pandas AI

이미지
딥러닝 심화   24.04.19 (금)  이미지수집 - 데이터라벨링 - 모델학습 - 예측 그동안 roboflow의 데이터셋이나, YOLO 모델을 불러와서 딥러닝 모델을 만들었는데, 드디어 이미지 수집부터 데이터라벨링, 학습과 예측까지 전과정을 직접해봤다. !!!  예측할 이미지 분야 결정   옷의 종류 (자켓, 바지, 치마, 드레스 등) free image 사이트에서 이미지 수집 길에서 찍은 전신샷 36개 수집함 폴더 구조 만들기 ybat-master 폴더 에 txt 파일 생성 → 클래스명 입력 ybat-master 폴더에 train / valid 폴더 각각 만들고 안에는 images, labels 두개의 폴더를 각각 만듦 images : 수집한 이미지 넣고, labels는 일단 비우기 데이터 라벨링해서 데이터셋 만들기 로컬에서 데이터 라벨링 툴을 활용해 바운딩 박스 생성 로컬에서 하는 이유 : 웹으로 하면 서버가 불안정해서 날라갈수도 있음 아래 사진과 같이 작더라도 흐리더라도 박스 추가  Save YOLO 버튼을 누르면, 이미지 이름별 박스 위치정보, 클래스 정보가 담긴 txt 파일이 만들어짐 labels 폴더로 이동  내가 직접한 이미지수집과 데이터 라벨링 출처 : ㄴㅏ YOLO_prac 폴더 생성하고 여기에 train, valid 폴더들 넣기 data.yaml 파일 만들기 메모장에서 아래와 같이 작성하고, 확장명을 yaml으로 저장 출처 : ㄴㅏ  클래스 이름의 순서는 classes에서 작성한 순서 그대로써야함 코랩에서 모델링 ultralytics 라이브러리 설치 YOLO 불러오기 data.yaml 파일의 경로 수정  YOLO 모델 선언 모델 학습 모델 예측  아래는 예측한 결과이다 !  생각보다 예측이 잘되서 너무 뿌듯 ^---------^  epochs = 50 으로 학습했을때 jacket / pants / dress 는 잘 인식이 ...

KT 에이블스쿨 : 딥러닝 심화 2일차 - 딥러닝, 객체인식, 데이터 라벨링

이미지
   딥러닝 심화 24.04.17 (수) - 2일차 딥러닝 복습 Kearas  1) Sequential 구조 Input() : 옵션 Dense() : 노드간 연결이 빽빽한 Fully connected 구조 Flatten() : 2차원 형태를 1차원으로 쫘악 펼쳐줌 2) Functional 구조  이미지 문제를 푸는 2가지 방법  1) 2차원인 이미지를 flatten으로 펼처서 1차원적으로 예측 RGB 컬러 이미지 → flatten하면 성능이 40% 미만으로 안좋음 2)  convolutional neural network (CNN) 2차원 이미지를 1차원 flatten 하지않고, 이미지 구조(2차원)을 살린채로 문제를 품 성능이 더 좋음 케라스로 CNN 구현 1) Conv2D   filters = 32 : 32개 특징 추출(피쳐맵) 특징한 윈도우 크기를 가진 피쳐맵이 움직이면서 특징을 추출함 kernel_size = (3, 3) : 필터의 가로세로 사이즈 strides = (1, 1)  : 필터의 이동 보폭, 얼마나 크게 / 작게 움직일건지  padding : 새롭게 만들어지는 피쳐맵은 작아지게 되어있는데, 계속 작아지면 곤란하니까 피쳐맵의 사이즈 유지 외곽에 중요한 정보가 있을수도 있으니가, 패딩으로 피쳐맵의 사이즈를 유지하고 외곽의 정보를 조금이라도 더 반영할려고 함 2) Maxpool2D 풀링기법이 많은데, 그중 maxpooling 기법을 쓴것 피쳐맵의 지역안에서 가장 큰 값만을 뽑아내고 나머지는 필요없겠구나를 의미 값이 클수록 큰 영향을 가진다는 것 = activation ‘relu’랑 잘 엮여서 사용되었음 (성능 좋아짐)  Feature Representation 연결된 것으로부터 기존에 없던 feature를 재표현, 생성함 CNN 에서 feature representation 이란 ?  위치 정보 를 보존한 채로 feature를 rep...

KT 에이블스쿨 : 딥러닝 심화 1일차 - 객체인식

이미지
  딥러닝 심화   24.04.16 (화)  딥러닝 심화로 무엇을 배울지 궁금했는데, 객체인식에 대해서 공부하게 됐다. 배운걸 간략하게 정리하자면, Object detection 구성요소랑 실습을 했다.  객체 인식 요소 Bounding Box (x, y, w, h 위치정보) Confidence Score : 확신 정도 IoU (Intersection over Union) : 정답박스랑 예측박스가 겹치는 영역 NMS (Non-Maximum Suppression) : 중복 박스 제거 Confidence Score의 한계점이 높을수록, IoU 한계점이 낮을수록 중복 박스에 대한 판단이 엄밀해짐  Precision, Recall AP (average precision) : precision - recall 곡선 그래프 아래의 면적 mAP (mean Average Precision) :  각 클래스 별 AP를 합산하여 평균을 낸 것 Annotation   :   이미지 내 Detection 정보를 별도의 설명 파일로 제공되는 것 image 파일에서 감지한 객체의 위치, 클래스 구분정보를 txt 파일로 저장 객체인식 코드 흐름 라이브러리 설치  !pip install ultralytics  라이브러리 불러오기  from ultralytics import YOLO YOLO 모델 선언  model = YOLO()   (선택) 모델 구조(model = 'yolov8n.pt') (선택) 가중치 설정(task = 'detect' 'OBB', 'pose', 'classification')  모델 학습 model.train()  (선택) 학습 파라미터 설정 가능  (선택) 모델 검증 모델 예측 - 예측 결과 생성 model.predict(save=True, save_txt=True) Roboflow   객체...

KT 에이블스쿨 : 딥러닝 기초 (회귀, 이중분류, 다중분류, MNIST, CNN, 성능관리)

이미지
  딥러닝 기초  1일차 - 24.04.11 (목)  그동안 어렵게만 느껴졌던 딥러닝을 오늘부터 한기영 강사님이랑 공부하게 되었다. 머신러닝, 딥러닝은 이름 자체부터 어렵게 느껴졌는데 강사님이 천천히 쉽게 가르쳐주셔서 따라가기 쉬웠다.  오늘 배운걸 간략하게 정리하자면, 딥러닝의 개념과 구조, 회귀 딥러닝 모델링을 배웠 머신러닝 복습   ML 알고리즘, 평가지표 중 R2 스코어의 의미 딥러닝 코드 순서   데이터 전처리( 스케일링 필수 ) → 모델 구조 선언, 컴파일 → 학습, 학습곡선 → 예측 및 검증   딥러닝 개념   가중치, fit 학습 절차(compile의 optimizer, epochs, learning_rate 비교) optimizer : 오차를 줄이는 방향으로 가중치를 조정하는 역할 epochs(ep) : 학습 반복 횟수  learing_rate(lr) : 학습 가중치 크기 조절 batch_size : 기본값으로 두면됨. 딥러닝 모델링 - 회귀    딥러닝 구조 Dense : 레이어  Dense(1, input_shape = (x_train.shape[1], )) model. compile (optimizer = Adam(learning_rate = 0.1), loss=’ mse ’) optimizer : 오차를 최소화하도록 가중치를 조절하는 역할  loss : 손실함수, 오차 계산을 무엇으로 할지 결정  학습곡선 history = model.fit(x_train, y_train, epochs = 20, validation_split=0.2).history 히든레이어  model3 = Sequential([ Dense( 4, input_shape = (nfeatures,), activation = 'relu' ), Dense(1) ]) 활성화함수 'relu' 사용 ...

[KT 에이블스쿨 - IT 트랜드] 4주차 | 아마존go, 프로세스 마이닝, 탈 클라우드

이미지
  에이블스쿨 스터디로 조원들과 IT 트랜드 발표 및 토론한 내용을 정리하고 있습니다  4주차 스터디 (4월 8일 ~ 12일)  1. 아마존go의 'Just Walk Out' 참고링크 아마존 Go  : 기존 무인 매장과 다르게 구매할 물건을 담기만하면 결제가 되는 매장 비교 : 일반적인 방식은 사람이 수동으로 바코드를 찍고 결제를 했더라면, 아마존 Go에서는 QR을 찍고 입장해 물건을 가방이나 카트에 담기만 하면 됨 (= just walk out)  활용기술 : 천장에 달린 카메라 센서(센서 융합)와 컴퓨터비전, 딥러닝 모델(CNN기반)을 사용 이는 자율주행 자동차와 유사한 기술이라고 함 음식 선반은 무게를 감지해서 사용자가 물건을 집었는지를 확인 가능  아마존 Go의 실패   3000개의 아마존Go매장을 운영할려고 계획했으나,  현재는 43개의 매장이 운영 중이며 작년 3월 미국에서는 8개의 매장이 폐쇄될 정도로 영업적 손실이 큰 매장이다. 실패의 원인 - 2가지  기술우선주의 : 참신함, 기술에 집중해서 '마트'라는 본질을 잊었다는 평가 비용  : 기술적인 비용 문제 → 100% 무인을 목표로 했지만 카메라 감시는 사람 Just walk out 기술- 활용 분야  사람이 몰리고, 시간이 중요한 장소 미국에선 공항, 대학, 스포츠 경기장 등 30개 시설에 이 기술 도입함 놀이동산 굿즈샵, 테마파크에 활용 가능할 듯  팝업스토어 상품이 많고 시간이 중요한 물류센터 상품 딜리버리 시장(배민 B마트 피킹 시스템) 기대효과 : 딜리버리 시간 감소의 효과, 주문량이 많아질 때 효율을 높일 수 있음 제시될 수 있는 문제점 : 'Just walk out' 기술을 사용하는 것이 비용이 더 들 수 있음 해결 방안 : 직원 옷을 통일하거나 특정한 모자를 쓰는 등 불필요한 학습 요소를 줄여 모델을 단순화, 피크 시간에...

이 블로그의 인기 게시물

KT 에이블스쿨 : 6-7차 미니프로젝트 - 제안서 기반 솔류션 기획 및 설계

KT 에이블스쿨 : 핀테크 아이디어 공모전

쿠팡 제품