Initial commit: Hermes Agent Skills collection

This commit is contained in:
Debian
2026-07-12 19:02:59 +00:00
commit e9cc106625
789 changed files with 233126 additions and 0 deletions
@@ -0,0 +1,43 @@
# ai.noris.de Endpoint Reference (Session 2026-06-18)
## Endpoint Details
- **URL**: `https://ai.noris.de/v1`
- **Type**: OpenAI-compatible Chat Completions
- **Auth**: Bearer token via `Authorization` header
- **API Key**: `sk-bf-8779d73c-6a51-49d6-a22f-00a0290ca6a7`
- **Models endpoint**: `GET /v1/models` → returns 4 models
## Discovered Models (2026-06-18)
| Model ID | Size | Notes |
|----------|------|-------|
| `vllm/gemma-4-31b-it` | 31B | Google Gemma 4 |
| `vllm/gpt-oss-120b` | 120B | GPT-OSS, largest model |
| `vllm/moonshotai/kimi-k2.6` | ~12B | Kimi K2.6, strongest generalist |
| `vllm/qwen3.6-27b-nvfp4` | 27B | Qwen 3.6 with NVFP4 quantization |
All models served via vLLM.
## Benchmark Results (Single Request, Synthetic 512/128)
### gemma-4-31b-it
- **TTFT**: 361.7 ms
- **Throughput**: 13.78 tok/s
- **ISL**: 512, **OSL**: 128
### gpt-oss-120b
- Slightly higher latency expected due to size
### moonshotai/kimi-k2.6
- Generally strongest quality
### qwen3.6-27b-nvfp4
- NVFP4 quantization is aggressive monitor quality vs. speed trade-off
## Endpoint Compatibility Notes
- **Prometheus metrics**: `/v1/metrics` returns HTML (web UI), not Prometheus exposition format
- `--no-server-metrics` recommended when benchmarking
- **GPU telemetry**: No DCGM endpoints exposed (localhost:9400/9401 unreachable)
- `--no-gpu-telemetry` recommended