Instructions to use cudo528/Darwin-9B-Opus-mlx-8bit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use cudo528/Darwin-9B-Opus-mlx-8bit with MLX:
# Make sure mlx-lm is installed # pip install --upgrade mlx-lm # Generate text with mlx-lm from mlx_lm import load, generate model, tokenizer = load("cudo528/Darwin-9B-Opus-mlx-8bit") prompt = "Write a story about Einstein" messages = [{"role": "user", "content": prompt}] prompt = tokenizer.apply_chat_template( messages, add_generation_prompt=True ) text = generate(model, tokenizer, prompt=prompt, verbose=True) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
- Pi
How to use cudo528/Darwin-9B-Opus-mlx-8bit with Pi:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "cudo528/Darwin-9B-Opus-mlx-8bit"
Configure the model in Pi
# Install Pi: npm install -g @mariozechner/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "mlx-lm": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "cudo528/Darwin-9B-Opus-mlx-8bit" } ] } } }Run Pi
# Start Pi in your project directory: pi
- OpenClaw new
How to use cudo528/Darwin-9B-Opus-mlx-8bit with OpenClaw:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "cudo528/Darwin-9B-Opus-mlx-8bit"
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "cudo528/Darwin-9B-Opus-mlx-8bit" \ --custom-provider-id mlx-lm \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
- MLX LM
How to use cudo528/Darwin-9B-Opus-mlx-8bit with MLX LM:
Generate or start a chat session
# Install MLX LM uv tool install mlx-lm # Interactive chat REPL mlx_lm.chat --model "cudo528/Darwin-9B-Opus-mlx-8bit"
Run an OpenAI-compatible server
# Install MLX LM uv tool install mlx-lm # Start the server mlx_lm.server --model "cudo528/Darwin-9B-Opus-mlx-8bit" # Calling the OpenAI-compatible server with curl curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "cudo528/Darwin-9B-Opus-mlx-8bit", "messages": [ {"role": "user", "content": "Hello"} ] }' - Hermes Agent
How to use cudo528/Darwin-9B-Opus-mlx-8bit with Hermes Agent:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "cudo528/Darwin-9B-Opus-mlx-8bit"
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default cudo528/Darwin-9B-Opus-mlx-8bit
Run Hermes
hermes
Darwin-9B-Opus (MLX 8-bit Optimized)
This repository provides an MLX-optimized 8-bit quantized version of FINAL-Bench/Darwin-9B-Opus, an ultra-efficient advanced reasoning model.
진화적 머지(Evolutionary Merge) 기법이 적용된 9B 체급의 강력한 모델을 Apple Silicon(Mac) 환경에서 원본의 성능 손실을 최소화하면서도 부드럽게 구동할 수 있도록 **8-bit(INT8)**로 양자화 및 포맷 변환을 완료한 버전입니다.
⚠️ Hugging Face View Note: 허깅페이스 시스템이 MLX 양자화 포맷을 파싱하는 과정에서 파라미터 수 및 텐서 타입 표기에 왜곡이 있을 수 있으나, 실제 8비트 가중치가 정상 적용된 파일입니다. 맥북 로컬 환경에서 정상 작동합니다.
🚀 Key Features
- High Precision (8-bit): 4비트 양자화 대비 원본 FP16 모델 고유의 하드코어 추론 성능과 텍스트 품질을 사실상 거의 그대로 보존하면서도, 메모리 대역폭 이득을 챙겼습니다.
- Top-Tier 9B Reasoning: 하드코어 박사급 추론 테스트인 **GPQA Diamond에서 82.5%**라는 체급 파괴 수준의 고득점을 기록했습니다. 깊은 사고 과정(
<thought>)을 통한 고난도 논리 추론이 가능합니다. - Agentic Capabilities: 코딩 에이전트(Coding Agent) 성능과 정교한 도구 호출(Tool Calling) 인터페이스를 기본 내장하고 있습니다.
- Global Multilingual: 한국어, 영어, 중국어, 일본어, 프랑스어, 독일어 등 10개 이상의 다국어 환경을 완벽하게 지원합니다.
🛠️ Installation
이 모델을 로컬 환경에서 구동하려면 최신 버전의 mlx-lm 라이브러리가 필요합니다.
pip install -U mlx-lm
💻 How to Use
1. Python API를 이용한 추론 코드
from mlx_lm import load, generate
# 본인의 8비트 저장소 이름으로 수정하여 사용하세요.
model, tokenizer = load("cudo528/Darwin-9B-Opus-mlx-8bit")
prompt = "수학적 귀납법의 원리를 중학생도 이해할 수 있게 쉬운 비유를 들어 한국어로 설명해줘."
response = generate(
model,
tokenizer,
prompt=prompt,
max_tokens=2048,
verbose=True # 모델의 심층 사고 과정(<thought>)을 터미널에서 실시간으로 보려면 True
)
print(response)
2. 터미널(CLI) 환경에서 즉시 실행
mlx_lm.generate --model cudo528/Darwin-9B-Opus-mlx-8bit --prompt "Write a Python script for a simple custom neural network layer." --max-tokens 1024
📂 Architecture & Lineage
- Original Base Model: FINAL-Bench/Darwin-9B-Opus
- Quantization Bit: 8-bit (INT8)
- Format: MLX Formatted (
.safetensors) - License: Apache-2.0
- Downloads last month
- 57
8-bit
Model tree for cudo528/Darwin-9B-Opus-mlx-8bit
Base model
FINAL-Bench/Darwin-9B-OpusEvaluation results
- Accuracy on GPQA Diamondself-reported82.500