DeepSeek LLM: Scaling Open-Source Language Models with Longtermism 논문 리뷰
DeepSeek AI는 영어와 중국어 분야에서 우수한 성능을 보이는 모델을 선보이는 동시에, 하이퍼파라미터와 모델·데이터 간 연산량 할당에 관한 정교한 스케일링 법칙도 제시했습니다.
Jan 4, 202421 min read24

Search for a command to run...
Articles tagged with #gqa
DeepSeek AI는 영어와 중국어 분야에서 우수한 성능을 보이는 모델을 선보이는 동시에, 하이퍼파라미터와 모델·데이터 간 연산량 할당에 관한 정교한 스케일링 법칙도 제시했습니다.

Mistral AI가 2023년 10월에 처음 선보인 Mistral 7B는 효율적인 아키텍처와 뛰어난 성능으로, 소형 오픈소스 언어 모델 분야에 새로운 변화를 가져왔습니다.

2023년 7월 Meta AI가 출시한 Llama 2는 거부 샘플링, RLHF, 레드팀 테스팅 등의 기법을 통해 대화 안전성 향상에 중점을 두었습니다. 이 모델은 유해 콘텐츠 제한과 유용성 사이의 균형을 찾는 새로운 기준을 제시했습니다.
