전체 글 (390) 썸네일형 리스트형 [ AI/시계열 분석] 시계열 분석 시계열 분석 시계열 데이터시간의 흐름에 따라 관찰된 데이터 ex)기온 데이터, 주가 데이터 등변동요인추세 변동: 장기간 걸쳐 점진적이고 지속적인 상승, 하락 상태계정 변동 : 주기적인 패턴을 가지고 반복적으로 나타나는 변동순환 변동 : 수년간의 간격을 두고 상승과 하락이 주기적으로 나타나는 변동불규칙 변동 : 명확히 설명될 수 없는 요인에 의해 발생되는 변동 전처리정산성시점에 따라 평균과 분산이 일정하지 않음, 분석한 데이터에 대하여 신뢰할 수 없음시점에 따라 평균과 분산이 일정하도록 전처리 필요=> 시계열 데이터는 시점에 따라 평균이나 분산이 변하지 않는 정산성(Stationary)을 만족해야 한다. 차분 변환 평활화 모델 학습AR- 자기자신의 과거 값이 미래를 결정하는 모델- 부분자기상관함수(.. [ AI/강화학습 ] 강화학습 강화학습 마르코프 체인마르코프 성질:과거 상태에 영향을 받지 않고 독립적으로 현재 상태로만 결정 상태전이확률:각 상태에서 다른 상태로 이동할 확률 예시과거의 경험으로 미루어 볼 때,오늘이 맑을 때 내일은 10번 중 8번 맑고오늘이 흐릴 때 내일은 10번 중 7번은 흐림질문: 이 때, 오늘 날씨가 맑을 경우 내일 날씨가 흐리고 모레 날씨도 흐릴 확률은?마르코프 성질 : 독립적 마르코프 결정 과정(MDP) 상태 S(t): t 시점에서 에이전트가 인식하고 있는 상화행동 A(t): t 시점에서 에이전트가 할 수 있는 행동보상 R(t): t 시점에서 에이전트가 행동을 할 때 얻을 수 있는 보상상태전이확률: 환경의 변화가 상태에 미치는 영향의 확률감가율: 현재에 가까운 보상일수록 보상이 크고 멁수록 보상이 적어지.. [ AI/비지도학습 ] 연관규칙 연관규칙, 항목들간의 조건-결과로 이루어지는 패턴을 발견하는 기법 출처https://www.youtube.com/watch?v=Lwgeilq7ksE 지지도 : A와 B 두 품목이 동시에 포함된 거래 비율신뢰도 : A품목이 거래될 때 B품목도 거래될 확률향상도 : A품목과 B품목의 상관성 Apriori알고리즘지지도 활용하여 어떤 연관집합이 자주 발생하는지 발견하는 알고리즘 원소 1개를 대상으로 최소 지지도 파악한다.최소 지지도가 3인 이유는 전체 7개 즉 분모가 결국 다 동일하게 7이기 때문에 분자만 생각하면 된다.apriori의 핵심의 원소개의 개수에 따라서 최소 지지도를 넘는가에 대한 질문이다. 한계점Apriori의 후보군 생성부화와 잦은 DB 스캔이 있음 극복:FP-Growth 알고리즘 트리구조를.. [ AI/비지도학습 ] 군집 계측적 군집 분석3 차원 축소 기법 출처:https://www.youtube.com/watch?v=zU2SrFFyxZY&list=PLWtr7MRpQi5DnZwe-RzaWa4zAgWvgsAOX&index=11 PCA 기법- 좌표에 선을 그어 그 점위 데이터를 나열하고 그 나열한 데이터의 분포를 파악- 좌표 2차원 => 선 1차원좌표 2차원에서 선 1차원으로 정보를 축소하면 정보는 당연히 손실단, 핵심은 PC1이 정보가 가장 적게 손실되고 축소되는 주성분분산이 결국 정보량 결국, 몇개로 최적의 축소가 해야할까에 대한 방법론: Screen Plot최적의 PC개수를 찾기 위한 주성분 개수와 분산을 비교하는 그래프하여, n차원에서 PC1과 PC2 2개로만 차원 축소 LDA: 지도학습 MDA: 거리 기반 t-SNE:국소적 군집화.. [ AI/비지도학습 ] 군집 계측적 군집 분석2 거리 기반- K-Means밀도 기반- DBScan확률 기반- 퍼지 군집화분포 기반- EM 알고리즘그래프 기반- 자기조직화지도(SOM) 출처:https://www.youtube.com/watch?v=9zprGZ-l4j4 K-Means 군집화- 각 데이터와 중심점의 거리를 측정 후 가장 가까운 그룹에 할당하여 K개의 군집으로 묶는 방법예시)1. 임의로 k = 3 설정2. 초기 중심정 3곳 설정 장점- 알고리즘의 이해와 적용이 쉬움- 데이터에 대한 사전 정보가 특별히 필요 없음단점- 초기 군집의 수를 정의하는데 어려움 => Elbow Method로 초기 값 설정 도움받음- 초기 중심점 설정에 따라 결과가 다르게 나옴- 노이즈나 이상치에 매우 민감 b/c 데이터의 평균으로 중심점을 재설정하게 되는데 노이즈.. [ AI/비지도학습 ] 군집 계측적 군집 분석 비지도학습 : 군집, 차원축소, 연관규칙 출처:https://www.youtube.com/watch?v=SZ7pVHyUUYY 군집: 계층적 군집분석응집형: 하나의 데이터를 하나의 군집으로 보고 가까운 군집끼리 병합해 나가는 방식1. 각 데이터간에 거리 계산2. 군집과 군집간에 거리 데이터간 거리 측정 방식1. 수치형 데이터- 유클리디안 거리- 맨하탄 거리- 마할라노비스 거리- 민코우스키 거리(p=1 => 맨하탄 || p=2 => 유클리디안) 2. 범주형 데이터- 자카드 유사도- 코사인 유사도 벡터란1. 특정 요소의 존재 여부(0 or 1) 로 나열한 수의 집합2. 크기와 방향을 통시에 갖고 있는 양전체 백화점 물건 전체 집합: [1,2,3,4,5]Customer A :[1,4,5]Customer B:.. [ LLM/Deepseek] 구조가 바뀌고 있다(Feat. V4.1) V4.1 어떻게 해서든 KV를 최소화 하라. prefill 8B active parameters/token, decode 16B같은 모델이라도 입력을 한꺼번에 읽는 단계(prefill)에서는 토큰당 약 8B(80억) 개 파라미터만 계산에 참여하고, 답을 한 토큰씩 생성하는 단계(decode)에서는 약 16B(160억) 개가 참여한다prefill=질문을 읽는 단계 active parameters모델 전체에 존재하는 파라미터 수가 아니라,그 토큰을 처리할 때 실제 계산에 참여하는 파라미터 수 Decoder = 답변을 만드는 단계decode 16B active parameters/token오늘오늘 날씨는오늘 날씨는 맑습니다...이처럼 다음 토큰을 하나씩 생성하는데,토큰 하나를 만들 때 약 160억 개의 파라미.. [ AI/Regression ] X와 Y 사이에 어떤 관계가 있을까?(Feat. 선형회귀) 회귀선이 평균보다 훨씬 잘 맞는다면, X가 Y 예측에 실제로 도움이 되는가?회귀는 X를 보고 Y를 예측하는 선을 만들고, 그 선이 실제값을 얼마나 잘 맞추는지 보는 방법 10, 20, 30이라는 숫자에서 아무 정보도 없이 모두에게 같은 값을 예측 한다면10 => 오차 큼30 => 오차큼20 => 가장 가운데 값평균은 회귀모델과 비교하기 위한 기준선 전체 변화 = 모델이 설명한 것 + 모델이 못 설명한 것SST: 실제값이 평균에서 얼마나 떨어져 있나 → 전체 변화량SSR: 평균보다 회귀선이 얼마나 설명했나 → 모델이 설명한 부분SSE: 회귀선과 실제값이 얼마나 떨어졌나 → 모델이 틀린 부분 SSE:모델이 틀린 양을 전부 모아놓은 점수SST:실제 데이터들이 평균 주변에 얼마난 넓게 흩어져 있는가SSR:.. [ LLM/Transformer Block ] Transformer Block 안을 들여다 보자 Trasnformer Block에 대해서 좀 더 자세히 알아 보자1. Prompt 입력2. Tokenization- 텍스트 -> token ID3. Embedding- ID -> 숫자 벡터4. Transformer Blocks- 문맥 계산 x 여러 층5. Final Norm- 최종 scale 정돈6. LM head- 벡터 -> Vocabulary 점수7. Logits / 확률- 후보 token의 점수8. Next Token- 하나 선택-> 다시 입력Attention 다른 Token에서 무엇을 가져올까를 계산 MLP현재 Otken의 표현을 어떻게 바꿀까를 계산 RMSNorm계산들이 아용할 숫자의 전체 scale을 정돈 Redisudal기존 정보를 유지하면서 새 계산 결과를 더함 Transformer B.. [ LLM/Ingerence ] 추론에 대해서 간단히 알아보 사용자가 질문을 주면, 모델이 그 뒤에 올 단어(Token)을 계속 생성하는 것. TrainingInference목적모델을 학습모델을 사용해서 답변을입력대량의 학습 데이터사용자의 PromptWeight 변경OX결과더 나은 모델답변 token예시GPT를 만드는 과정Chat GPT에게 질문 Training1. 수많은 문장2. 모델이 예측3. 정답과 비교4. 오차 계산5. weight 수정 Inference │1. Prefill │ 질문을 읽는다 2. Decode 답을 쓴다Prefill = "질문을 읽는 단계"Decode = "답변을 쓰는 단계" Decode는 한 번에 한 번씩 밖에 출력 안됨.1. token 하나를 만들 때 처리해야 하는 모델의 비용을 줄이자 Cheaper Model == Token .. [ AI/Kimi ] 중국이 처음 미국을 이겼다. 항목k2/k2.6k3의미전체 파라미터약 1조2.8조저장된 지식, 기능 후보 공간 확대전문가수384개 중 8개 선택896개 중 16개 선택계산량 증가를 억제하면서 모델 욕량 확대문맥 길이128K→256K(2025.9)→256K 유지1M 토큰대형 코드 저장소, 다수 문서, 장기간 작업 처리핵심 attention주로 MLAKDA+Gated MLA장문 처리 비용과 기억 효율 개선깊이 방향 연결일반 RedisudalAttention Residual이전 층의 정보를 선택적으로 재사용독립 Intelligence Index4457종합 능력의 실질적 상승 KDA 란KDA는 긴 대화를 전부 KV cache에 쌓지 않고, 새 토큰이 들어올 때마다 작은 숫자 메모리에서 오랜된 관계를 선택적으로 지우고 새로운 관계를 써 넣는.. [ AI/LLM ] 어떻게 검증할 것인가? 모델을 답변을 이진 질문으로 검증하는 방법https://arxiv.org/abs/2606.27226 Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-ImprovementEvaluating LLM outputs remains a major bottleneck in NLP: human evaluation is expensive and slow, lexical metrics correlate poorly with human judgments on open-ended generation, and holistic LLM judges often produce opaque scores that are hard to debug. .. 이전 1 2 3 4 ··· 33 다음