john-data-chen

60 mods across 1 repository, 2 stars between them.

llama-cpp

51

john-data-chen/hermes-agent-backup

Skill Claude CodeCodex

Use this skill for local GGUF inference, quant selection, or Hugging Face repo discovery for llama.cpp.

2 1mo ago A 18 tokens copy · 98% MIT

serving-llms-vllm

52

john-data-chen/hermes-agent-backup

Skill Claude CodeCodex

Use when deploying production LLM APIs, optimizing inference latency/throughput, or serving models with limited GPU memory. Supports OpenAI-compatible endpoints, quantization (GPTQ/AWQ/FP8), and tensor parallelism.

2 1mo ago A 27 tokens copy · 88% MIT