跳到正文
Text
Matrix
技术笔记
行业快讯
视频精读
财富自由
思考与随笔
搜索
Text
Matrix
搜索
技术笔记
行业快讯
视频精读
财富自由
思考与随笔
VLLM
2026
08-05
DeepSeek V4 Flash 单卡 AMD MI300X:ryanzhou 把 vLLM-ROCm 调成 168.6 tok/s 单流 + 64 流 830 tok/s 的工程复盘
07-13
colibrì 引擎拆解:在 25GB RAM 上跑 744B MoE 模型,纯 C 实现,比 vLLM-Moet 快 2.5 倍
07-01
olmOCR:用 7B VLM 把 PDF 线性化成 LLM 训练语料
06-30
Ornith-1.0 深度解读:自改进开源 agentic coding 模型,4 个尺寸 + Self-Improving Framework 突破
06-30
Micro-Agent:在 Model API 内部用协作打 frontier model——vLLM Semantic Router 拆解
06-28
EAGLE-1/2/3 拆解:推测解码省的是大模型前向次数,赚不赚看草稿准确率
06-25
2×GH200 跑 GLM-5.2:从 2.39 tok/s 到 54.92 tok/s,局部性铁律贯穿全文
06-13
LMCache 深度解析:把 LLM 推理的 KV Cache 从临时状态改造成可复用资产
06-04
Odysseus:一站式自托管 AI 工作台,把 ChatGPT/Claude 体验搬回本地
05-12
MinivLLM:六步搭出一个 Qwen3 推理引擎,再核清四处文档与代码的分岔
04-29
RTX 3090 本地运行 LLM 实战:vLLM 与 llama.cpp 双引擎对比
04-17
DFlash:把扩散模型关进草稿阶段,投机解码才拿到五倍加速