搞懂缓存机制,从Gemma4到Claude Code省80%Token 早上打开 Claude Code,敲第一句话,2%~10% 的套餐额度没了。午休回来继续干活,又一句话,10% 的额度蒸发。你有没有想过,这 token 到底花在哪了?我带着这个疑问,在本地用 Gemma4 跑小模型做实验——发现同一段对话,有些轮次要等 30 秒,有些只要 0.2 秒。为了搞清楚为 2026-07-23 技术 #Claude Code#大模型#效率工具#技术#缓存机制#Token优化
多模态信息抽取_CLIP模型 Title: Learning transferable visual models from natural language supervision paper:https://arxiv.org/pdf/2103.00020 代码:https://github.com/OpenAI/CLIP 2026-07-23
多模态大模型——pdf 识别 1. 多模态大模型——pdf 识别 本文将会介绍两种 pdf 识别理解的方法。 下面的内容都是在百炼大模型中实现的。 首先,我通过通义 qwen OCR 的角度入手。 我发现ocr 可以识别图片但是,在处理 pdf 的过程中需要操作一下 2026-07-23 人工智能 #Qwen#OCR#多模态大模型#PDF 解析#通义千问#Qwen-Long
到底什么是 Embedding 近几年,“大语言模型”(LLM)凭借其强大的文本理解和生成能力,正在改变我们与数字世界的交互方式。 而在这背后,一个名为Embedding的关键技术,默默地扮演着连接语言与数学的"翻译官"角色。 1. 什么是 Embedding? 简单来说,Embedding 是一种将非结构化数据(如文本、图像、音 2026-07-23 AI #Embedding#向量数据库#LLM#RAG#余弦相似度#Ollama#Elasticsearch
大模型压测总踩坑:显存 OOM 与 TTFT 解决指南(附代码与避坑清单) 电商平台上线 AI 客服大模型,仅用 10 条短 prompt 简单地测了个 QPS=50 便直接投入运行。 结果在大促当天,用户发来的长 prompt 占比陡然增至 40%,而并发量刚达到 30 时,显存便立刻爆了 OOM(Out Of Memory),客服系统直接宕机长达两小时,所造成的损失超过 2026-07-23 编程 #vLLM#大模型压测#显存 OOM#TTFT#Locust#推理优化
大模型小知识:解构 GGUF 文件 大模型小知识:解构 GGUF 文件 在使用大型语言模型时,我们经常会遇到一些现实问题: 模型文件太大、加载太慢、部署麻烦、兼容性差…… 尤其是当你尝试在本地电脑甚至手机上运行一个几百亿参数的模型时,这些问题就会变得尤为明显。 于是,**GGUF(GPT-Generated Unified Forma 2026-07-23 AI 工程 #GGUF#大模型#LLM#模型部署#量化
大模型下半场:从 LLM-RL 到 Agentic RL 全新范式 1. 大模型下半场:从 LLM-RL 到 Agentic RL 全新范式 由牛津大学、上海 AI Lab、新加坡国立大学等 16 家研究机构联合发表的 100 页综述,首次系统提出**Agentic RL(代理式强化学习)**范式:把大语言模型(LLM)从 2026-07-23 AI #大模型#强化学习#LLM#综述#Agentic RL#Agent
大模型推理中的_Prefill_Decode_分离技术的一些思考 近年来,随着大语言模型(Large Language Models, LLMs)在各类应用场景中广泛部署,如何高效、稳定、低成本地提供推理服务,已成为工业界关注的核心问题。 在这一背景下,“PD 分离”——即Prefill(预填充)与 Decode(解码)阶段的分离调度——逐渐成为高性能推理引擎的关 2026-07-23 AI架构 #LLM#推理优化#KV Cache#vLLM#PD 分离#Prefill#Decode
大模型如何重塑代码生成_深度拆解Qwen3-Coder的技术内核与未来演进 还记得第一次使用代码补全工具时的惊喜呢?它就像是一位十分贴心的副驾,帮助你补全变量名,与此同时也会提示 API 呢。不过如今,像 Qwen3-Coder 这样的大模型,已然不再是单纯的 " 副驾 " 了,它正努力地想要成为能够独自完成复杂编程任务的 " 自动驾驶系统 " 呢。在这背后,是一场从模型架 2026-07-23