Llama, Mistral 및 Qwen 개요
세 가지 주요 오픈 웨이트 모델 제품군의 라이선스, 크기, 적합한 용도를 알아보세요.
Llama, Mistral 및 Qwen 개요은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
이 강의의 일부는 아직 번역되지 않았으며 영어로 표시됩니다.
공개 소스의 장점
공개 가중치 모델은 다음과 같은 이점을 제공합니다:
- 토큰별 API 비용이 없습니다
- 데이터 프라이버시가 보장됩니다. 모델이 자체 하드웨어에서 실행됩니다
- 어떤 규모에서든 사용자 지정할 수 있습니다(미세 조정)
- 특정 공급업체에 종속되지 않습니다
비용은 엔지니어의 작업 시간, GPU 비용, 그리고 대개 최첨단 모델보다 낮은 품질입니다.
Llama 제품군(Meta)
- 2023~2025년에 1B부터 405B까지의 규모로 출시되었습니다
- Llama 3.x는 매우 뛰어난 성능을 보이며, 8B는 중간급 폐쇄형 모델과 경쟁합니다
- 커뮤니티 라이선스를 사용합니다(조건부 상업적 이용 허용)
- 생태계가 매우 크며, 대부분의 미세 조정 모델이 Llama에서 파생되었습니다
Mistral 제품군(Mistral AI)
- Mistral 7B Instruct — 강력한 소형 모델
- Mixtral 8x7B — 전문가 혼합 방식으로 빠르고 뛰어난 성능을 제공
- Mistral Large / Medium — 가중치가 공개되지 않았으며 API로 제공
- 공개 변형 모델에는 Apache 2.0 라이선스 적용
Qwen 제품군(Alibaba)
- Qwen 2.5 — 최상위 공개 가중치 추론 모델(2024년)
- 특히 중국어를 비롯한 다국어 지원이 뛰어남
- 0.5B부터 72B까지의 규모
- Apache 2.0
그 밖의 주목할 모델
- Gemma(Google) — 작고 완성도가 높음
- Phi(Microsoft) — 매우 작지만 뛰어난 성능
- DeepSeek — 더 낮은 비용으로 강력한 추론 제공
- Yi — 뛰어난 다국어 지원
규모 선택
| 규모 | 사용 사례 |
|---|---|
| 1-3B | 엣지 장치, 모바일, 분류 |
| 7-8B | 단일 GPU, 간단한 에이전트 |
| 13-30B | 더 큰 GPU 또는 소형 GPU 2~4개, 실제 에이전트 |
| 70B+ | 다중 GPU, 최첨단 수준의 품질 |
중요한 벤치마크
- MMLU — 일반 지식
- GSM8K — 수학
- HumanEval — 코드
- MT-Bench — 대화 품질
- HELM / LMSYS Chatbot Arena — 사람의 선호도
YOUR 작업에 맞는 벤치마크를 선택하십시오.
최첨단 모델과의 격차가 줄어들고 있습니다
최첨단 폐쇄형 모델(GPT-4o, Claude Sonnet 4.5)은 여전히 가장 어려운 벤치마크에서 앞서 있습니다. 하지만 공개된 70B 모델은 대부분의 에이전트 작업에서 중간급 폐쇄형 모델과 비슷한 성능을 냅니다.
라이선스 고려 사항
모든 모델의 라이선스를 확인하십시오:
- Apache 2.0 — 제한 없이 사용할 수 있음
- Llama 커뮤니티 라이선스 — 대규모 서비스와 특정 사용 사례에 제한이 있음
- 일부 "연구 전용" 라이선스 — 상업적으로 배포할 수 없음
호스팅 방식과 자체 호스팅 방식
인프라를 직접 운영하지 않고도 호스팅 API(Together AI, Anyscale, Groq, Fireworks)를 통해 공개 모델을 사용할 수 있습니다. 같은 품질이라면 OpenAI보다 저렴한 경우가 많습니다.
Hosted Open Models on Groq
from openai import OpenAI
client = OpenAI(
base_url='https://api.groq.com/openai/v1',
api_key=GROQ_KEY
)
response = client.chat.completions.create(
model='llama-3.1-70b-versatile',
messages=[{'role': 'user', 'content': 'Hello'}]
)OSS가 우세한 경우
- 프라이버시가 중요한 경우: 의료, 법률, 국방
- 사용량이 매우 많은 경우: 호출당 몇 센트의 차이가 중요함
- 대규모 사용자 지정이 필요한 경우: 특정 분야를 위한 미세 조정
- 폐쇄형 공급업체의 다국어 지원이 약한 경우
폐쇄형 모델이 우세한 경우
- 최첨단 추론
- 멀티모달 작업(비전, 음성)
- 긴 컨텍스트: Claude와 Gemini가 여전히 앞섬
- 빠른 프로토타이핑
성능을 충족하는 가장 작은 모델
단일 GPU에서 실행되는 간단한 내부 에이전트에는 일반적으로 어떤 규모 범위를 사용합니까?
복습
Llama, Mistral, Qwen이 대표적인 세 제품군입니다. 품질 요구 사항을 충족하는 가장 작은 규모를 선택하십시오. 호스팅 공급업체(Groq, Together)를 사용하면 인프라를 직접 운영하지 않아도 됩니다.
자주 묻는 질문
“Llama, Mistral 및 Qwen 개요” 강의는 무료인가요?
네 — “Llama, Mistral 및 Qwen 개요” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
“Llama, Mistral 및 Qwen 개요”에서 뭘 배우나요?
세 가지 주요 오픈 웨이트 모델 제품군의 라이선스, 크기, 적합한 용도를 알아보세요. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Agents을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.
“Llama, Mistral 및 Qwen 개요” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- Llama, Mistral 및 Qwen 개요
- Ollama와 llama.cpp로 로컬 모델 실행
- 함수 호출 오픈 모델(Hermes, Functionary)
- 절충점: 지연 시간, 비용, 성능