diff --git a/README.md b/README.md index b55da9b..9709924 100644 --- a/README.md +++ b/README.md @@ -2,7 +2,7 @@ llama.cpp CUDA runner for **Qwen3.6-35B-A3B** (UD-Q4_K_M) at **128k context** on 4n4rch02. -Port **18008**, OpenAI-compatible API at `http://192.168.3.189:18008/v1`. +Port **18010**, OpenAI-compatible API at `http://192.168.3.189:18010/v1`. ## Host @@ -262,7 +262,7 @@ Loads in ~15 s (`--no-mmap`, weights read from NVMe). ## Benchmarks ```bash -python3 bench/bench.py --port 18008 --depths 512,8192,32768 --n-predict 128 +python3 bench/bench.py --port 18010 --depths 512,8192,32768 --n-predict 128 ./bench/sweep.sh 10:24,16:8 8:24,16:8 # :: python3 bench/spec_bench.py --no-think # copy/code/prose generation workloads ``` diff --git a/bench/bench.py b/bench/bench.py index da8d23e..0f411c2 100755 --- a/bench/bench.py +++ b/bench/bench.py @@ -40,7 +40,7 @@ def bench(port, prompt_tokens, n_predict, label): if __name__ == "__main__": ap = argparse.ArgumentParser() - ap.add_argument("--port", type=int, default=18008) + ap.add_argument("--port", type=int, default=18010) ap.add_argument("--label", default="run") ap.add_argument("--depths", default="512,8192,32768,131072") ap.add_argument("--n-predict", type=int, default=128) diff --git a/bench/reasoning_budget_probe.py b/bench/reasoning_budget_probe.py index e3c5707..752287a 100755 --- a/bench/reasoning_budget_probe.py +++ b/bench/reasoning_budget_probe.py @@ -53,7 +53,7 @@ def probe(port, label, extra): if __name__ == "__main__": ap = argparse.ArgumentParser() - ap.add_argument("--port", type=int, default=18008) + ap.add_argument("--port", type=int, default=18010) ap.add_argument("--case", choices=["default", "override", "off"], default="default") ap.add_argument("--budget", type=int, default=16384) a = ap.parse_args() diff --git a/bench/spec_bench.py b/bench/spec_bench.py index 7b0fa27..f712cd2 100755 --- a/bench/spec_bench.py +++ b/bench/spec_bench.py @@ -61,7 +61,7 @@ def run(port, name, prompt, n_predict, no_think): if __name__ == "__main__": ap = argparse.ArgumentParser() - ap.add_argument("--port", type=int, default=18008) + ap.add_argument("--port", type=int, default=18010) ap.add_argument("--label", default="run") ap.add_argument("--n-predict", type=int, default=400) ap.add_argument("--no-think", action="store_true", diff --git a/bench/sweep.sh b/bench/sweep.sh index 7776e93..10de3ac 100755 --- a/bench/sweep.sh +++ b/bench/sweep.sh @@ -4,12 +4,12 @@ # Usage: ./sweep.sh :[:] ... # Example: ./sweep.sh 10:24,16:8 8:24,16:8 # -# Env: CTX (default 131072), DEPTHS (default 512,8192), PORT (default 18008) +# Env: CTX (default 131072), DEPTHS (default 512,8192), PORT (default 18010) HUB=${HUB:-/mnt/2TSAM990nvme/docker-volume-outsource/llm-models/hf/hub/models--unsloth--Qwen3.6-35B-A3B-GGUF} SNAP=${SNAP:-snapshots/a483e9e6cbd595906af30beda3187c2663a1118c/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf} CTX=${CTX:-131072} -PORT=${PORT:-18008} +PORT=${PORT:-18010} NAME=qwen36-sweep BENCH=${BENCH:-$(dirname "$0")/bench.py} diff --git a/docker-compose.yml b/docker-compose.yml index 862d8ca..aa28ce1 100644 --- a/docker-compose.yml +++ b/docker-compose.yml @@ -72,9 +72,9 @@ services: - --host - 0.0.0.0 - --port - - "18008" + - "18010" healthcheck: - test: ["CMD", "curl", "-sf", "http://localhost:18008/health"] + test: ["CMD", "curl", "-sf", "http://localhost:18010/health"] interval: 30s timeout: 10s retries: 3