전체 글 12

pdf2zh(Window version)+ ollama(linux version) 이용해서 번역하기

pdf2zh : 논문 보실 때, PDF(영어) -> 번역  -> PDF(한글)로 출력해주는 프로그램 입니다. (물론 다른 언어도 됨.)  GradioBuild & Share Delightful Machine Learning Appswww.gradio.apphttps://pdf2zh.com/ : 웹 버전으로도 편리하게 그냥 사용할 수 있습니다.  하지만, 멋지게 CLI(Command Line Interface)로 하는 방법도 있습니다.그리고 보안이 중요한 문서들을 번역할 때는 망설여집니다.   그럴 때, ollama 라는 tool을 활용해서 로컬 영역에서 LLM을 구축하고 구축된 LLM으로 번역을 하는 방식으로 pdf2zh를 사용할 수 있습니다!   pdf2zh 설치 (파이썬이 설치되었다는 가정 하에) #..

Wilcoxon Rank Sum Test에서 p-value 계산 과정 (예제 포함)

Wilcoxon Rank Sum Test(= Mann-Whitney U test)는 두 그룹의 분포 차이를 비교하는 비모수 검정입니다. 순위를 기반으로 검정 통계량을 계산한 후, 이를 이용해 p-value를 구하는 과정을 예제로 설명하겠습니다.  1️⃣ 예제 데이터두 그룹의 데이터를 예제로 들어보자.그룹 A (X1​): [8,12,14]그룹 B (X2​): [7,10,15,18]이제 Wilcoxon Rank Sum Test를 수행하면서 p-value를 계산해보자! 2️⃣ 모든 데이터를 하나로 묶어 순위(Rank) 계산두 그룹을 합친 후 오름차순 정렬작은 값부터 순위 부여 (동순위 값이 있으면 평균 순위 할당)값그룹순위 (R)7B18A210B312A414A515B618B7  3️⃣ 그룹 A의 순위 합 R1..

통계 2025.02.26

t-test : t-검정 통계량 계산 방법

t-검정 (t-test) 식독립 표본 t-검정 (Independent t-test)두 그룹 X1, X2 의 평균이 같은지 비교하는 검정으로, 가설은 다음과 같음:귀무가설 (H0​): 두 그룹의 평균이 같다. (μ1=μ2​)대립가설 (H1​): 두 그룹의 평균이 다르다. (μ1≠μ2​)t-검정 통계량은 다음과 같이 계산함.  대응 표본 t-검정 (Paired t-test)독립표본 식에서 n1 = n2 가 동일한 경우임

통계 2025.02.26

비모수 데이터에서 t-test를 진행하게 되면?

비모수 데이터셋에서 t-검정 (t-test) 을 사용하면 다음과 같은 문제가 발생할 수 있습니다. 정규성 가정 위배t-검정은 정규 분포를 가정하는데, 비모수 데이터(즉, 정규성을 따르지 않는 데이터)에 적용하면 결과가 신뢰할 수 없을 수 있음.특히, 샘플 크기가 작을 경우 정규성 위반이 분석 결과에 큰 영향을 줄 수 있음.실제보다 더 작은 p-value가 나올 수 있음. -> 유의하지 않은 차이를 유의하다고 판단할 수 있음! 이상치에 취약t-검정은 평균과 표준편차를 기반으로 하기 때문에 이상치(outlier)의 영향을 크게 받을 수 있음.비모수 데이터는 종종 이상치가 많거나 분포가 치우쳐 있는 경우가 많아 t-검정을 적용하면 왜곡된 결과가 나올 수 있음.만약 이상치가 있다면 두 그룹의 차이가 과장 될 수..

통계 2025.02.26

GPTs 개인정보 보호 정책

1. 개요본 정책은 GPT(이하 "서비스")가 사용자 정보를 수집, 사용, 저장 및 보호하는 방식에 대해 설명합니다. 우리는 사용자의 개인 정보를 보호하고, 관련 법규를 준수하며, 투명한 데이터 처리를 최우선으로 합니다.2. 수집하는 정보우리는 다음과 같은 정보를 수집할 수 있습니다.사용자가 제공하는 정보: 서비스 이용 시 입력하는 텍스트 데이터자동 수집 정보: IP 주소, 기기 정보, 쿠키 및 로그 데이터3. 정보의 이용 목적수집한 정보는 다음과 같은 목적에 사용됩니다.서비스 제공 및 개선사용자 경험 최적화보안 및 사기 방지4. 정보 공유 및 제공우리는 원칙적으로 사용자의 정보를 제3자와 공유하지 않습니다. 다만, 다음과 같은 경우 예외적으로 제공될 수 있습니다.법적 요구가 있을 경우서비스 운영을 위한..

GPT 2025.02.24

자연어 처리 : 1. 시소러스

자연어 처리의 역사를 되돌아보면, 단어의 의미를 인력을 동원해 정의하려는 시도는 수없이 있어왔습니다. 단, '표준국어대사전' 같이 사람이 이용하여 일반적인 사전이 아니라 시소러스 형태의 사전을 사용했습니다.  시소러스란 기본적으로 '유의어 사전'으로 '뜻이 같은 단어(동의어)'나 '뜻이 비슷한 단어(유의어)'가 한 그룹으로 분류되어 있습니다.  예시)car = auto, automobile, machine, motorcar 단어 사이의 '상위와 하위' 혹은 '전체와 부분' 등 을 정의해둔 경우 예시)objectmotor vehiclecarSUVcompacthatch-backgo-karttruck"car"의 상위 개념으로 "motor vehicle(동력차)"이라는 단어가 존재하고 "car"의 하위 개념으로..

선형회귀(Linear regression) 이해하기

선형 회귀를 이해하기 전에 단어 하나하나의 의미 부터 살펴봅시다. 선형(Linear) : 말 그대로 '선' 또는 '선의 형태'를 의미합니다. 회귀분석(Regression) : 독립변수가 종속변수에 어떠한 영향을 미치는지 알아보고자 할 때 실시함. 합쳐보면, "독립변수과 종속변수의 관계가 선형으로 나타나는지 분석하기" 정도인 것 같습니다. #기본지식 독립변수(설명변수) : 다른 변수에 영향을 받지 않는 변수, 종속변수에 영향을 주는 변수, 연구자가 의도적으로 변화시키는 변수 , 원인 종속변수(반응변수) : 독립변수가 변화함에 따라 변하는 변수, 예측하고자 하는 변수, 결과 통계학에서는, 다음과 같이 정의하고 있습니다. -> 한 개 이상의 독립 변수 X와 종속 변수 y와의 선형 상관 관계를 모델링 하는 회귀..

Machine Learning 2022.07.27

Model이란

1. AI 세계에서의 Model이란 무엇을 의미하는 것일까요? Model이란 무엇인가를 예측해주는 도구라고 생각하면 좋을 것 같습니다. 인간들은 끊임없이 무엇인가를 예측하려는 노력을 하고 있습니다. 예를 들어, 기상청 사람들은 내일의 날씨를 예측하고 싶어하고 주식 투자자들은 내일의 주식 동향을 예측하고 싶어합니다. 기상은 산업 전반적인 영역 지대한 영향을 미치고 있기 때문에 기상을 예측한다는 것은 굉장히 중요한 일이고 내일의 주식 가격을 예측할 수 있다면 떼 돈을 벌 수도 있습니다. 이처럼 무엇인가를 정확하게 예측할 수 있다는 것은 정말로 대단한 일입니다. 그렇다면 Model이 어떻게 예측을 할 수 있을까요? 기존에 우리가 알고 있는 정보를 기반으로 Model이 학습을 하고 그것을 기반으로 새로운 문제가..

Machine Learning 2022.07.26

R : 외부 데이터 불러오기 < xlsx, csv, tsv >

들어가기에 앞서... 데이터프레임을 직접 만들 수도 있지만, 대부분의 경우에는 이미 만들어져 있는 데이터를 데이터프레임 형태로 불러와서 분석합니다. 외부 데이터는 다양한 형태로 저장이 되어 있습니다. 저장되어 있는 형식에 맞게 데이터를 불러와야 합니다. 이번 시간에는 각 데이터 형식에 맞게 데이터를 불러오는 방법을 알아보겠습니다. 1. 엑셀파일 엑셀 파일을 불러오기 위해서는 패키지 설치부터 먼저 해야합니다. readxl 라이브러리를 로딩하고 나면 read_excel() 함수를 이용해서 엑셀 파일을 불러옵니다. 그 전에 불러오기 위한 엑셀파일을 하나 만들어 보겠습니다. Sheet1 에는 학생 A,B,C,D의 영어와 수학 점수가 있고, Sheet2 에는 과학과 경제학 점수가 있습니다. 먼저 Sheet1 데이..

RNA-seq의 첫 걸음

RNA-seq에 대해서 들어보셨나요? 생명 쪽 관련 공부나 일을 하시는 분들은 한 번 쯤은 꼭 들어보셨을겁니다. 이번 시간에는 RNA-seq에 대한 기본 개념에 대해서 알아보겠습니다. RNA-seq이 무엇이고 왜 하는건가요? RNA-seq은 'RNA sequencing'을 줄여서 부르는 말입니다. RNA의 염기 서열을 순서대로 읽어나가는 실험이라고 생각하시면 간단합니다. 그렇다면 RNA 염기서열을 왜 읽을까요? 인간은 약 2만여개의 유전자 정보를 가지고 있습니다. 다시말해, 모든 세포가 동일하게 2만 여개의 유전자 정보를 가지고 있습니다. 하지만 각 세포들은 서로 다른 일을 합니다. 어떤 세포는 외관을 구성함과 동시에 외부의 물리적인 자극으로 부터 몸을 보호하는 역할(상피세포)을 하고 또 어떤 세포는 외..