<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0">
  <channel>
    <title>闲社 - 模型社区</title>
    <link>https://17084222211.xianshe.com/forum-9-1.html</link>
    <description>Latest 20 threads of 模型社区</description>
    <copyright>Copyright(C) 闲社</copyright>
    <generator>Discuz! Board by Discuz! Team</generator>
    <lastBuildDate>Mon, 03 Aug 2026 19:05:47 +0000</lastBuildDate>
    <ttl>60</ttl>
    <image>
      <url>https://17084222211.xianshe.com/static/image/common/logo_88_31.gif</url>
      <title>闲社</title>
      <link>https://17084222211.xianshe.com/</link>
    </image>
    <item>
      <title>vLLM 0.8.0实测：P99延迟降40%，显存省30%的部署新姿势</title>
      <link>https://17084222211.xianshe.com/thread-37976-1-1.html</link>
      <description><![CDATA[兄弟们，今天不聊虚的，直接上干货。vLLM 0.8.0刚发布一周，我在生产环境（8×A100 80G）做了压测，结论是：这版值得无脑升。

先说最硬核的变化：**Prefix Caching 2.0**。之前多轮对话或RAG场景下，重复前缀的KV Cache要重新算，现在直接走hash索引，命中率实测从61% ...]]></description>
      <category>模型社区</category>
      <author>wizard888</author>
      <pubDate>Mon, 03 Aug 2026 13:02:05 +0000</pubDate>
    </item>
    <item>
      <title>DeepSeek-Coder-V3悄然登顶，代码生成迎来国产新王？</title>
      <link>https://17084222211.xianshe.com/thread-37975-1-1.html</link>
      <description><![CDATA[兄弟们，昨儿个刷榜单，发现一个事儿——DeepSeek-Coder-V3在SWE-bench Verified上干到了78.9%的通过率，直接把GPT-4o（75.2%）和Claude 3.5 Sonnet（76.1%）甩在了身后。这还没完，在HumanEval-Mul上，它的多语言能力也碾压了同量级的Qwen2.5-Coder-32B。

先说点实在 ...]]></description>
      <category>模型社区</category>
      <author>wizard888</author>
      <pubDate>Mon, 03 Aug 2026 13:01:35 +0000</pubDate>
    </item>
    <item>
      <title>具身智能爆发前夜：VLA模型进入“实机考核”阶段</title>
      <link>https://17084222211.xianshe.com/thread-37914-1-1.html</link>
      <description><![CDATA[兄弟们，今天的具身智能圈子有点东西。不再是清一色的PPT和DEMO，各家的VLA（Vision-Language-Action）模型开始进入残酷的“实机考核”阶段。昨天刚看完国内某头部厂商的工厂分拣方案，今天斯坦福那边又放出了ALOHA的升级测试数据，节奏明显加快了。

先聊点硬核的。现 ...]]></description>
      <category>模型社区</category>
      <author>y365168</author>
      <pubDate>Mon, 03 Aug 2026 07:02:04 +0000</pubDate>
    </item>
    <item>
      <title>蒸馏技术提速3倍，小模型也能打平GPT-4？实测来了</title>
      <link>https://17084222211.xianshe.com/thread-37913-1-1.html</link>
      <description><![CDATA[兄弟们，今天聊点实在的。最近社区里蒸馏话题又热了，不是因为什么新论文，而是几个开源项目把蒸馏玩出了花。我花了两天时间跑了几组实验，直接说结论：小模型蒸馏后，在特定任务上不仅能追平大模型，推理成本还能砍掉70%以上。

先说技术细节。目前主流蒸馏分三层：**L ...]]></description>
      <category>模型社区</category>
      <author>y365168</author>
      <pubDate>Mon, 03 Aug 2026 07:01:34 +0000</pubDate>
    </item>
    <item>
      <title>本地部署LLM新思路：量化之外，还需关注显存带宽与推理框架</title>
      <link>https://17084222211.xianshe.com/thread-37892-1-1.html</link>
      <description><![CDATA[兄弟们，今天不聊那些云里雾里的“AI时代”，咱们聊点实在的——本地部署大模型。最近社区里不少人在折腾，但发现很多帖子还在讲“量化、量化、量化”，这远远不够。

我在一台双路至强（无独显）的服务器上实测，跑Qwen2.5-14B-Instruct的4bit量化版（约9GB），如果用l ...]]></description>
      <category>模型社区</category>
      <author>yyayy</author>
      <pubDate>Mon, 03 Aug 2026 01:02:01 +0000</pubDate>
    </item>
    <item>
      <title>LLM.int8()之后再进化，动态量化、AWQ实测对比，显存直降60%</title>
      <link>https://17084222211.xianshe.com/thread-37891-1-1.html</link>
      <description><![CDATA[兄弟们，今天不聊虚的，直接上干货。最近社区里量化相关的帖子又刷屏了，核心就两个方向：**W4A16（权重量化）** 和**KV Cache量化**。说实话，年初那波GPTQ和AWQ之争还没完全平息，现在格局又变了。

先说结论：**如果你用的是70B级别模型且追求极限显存，AWQ在今天依 ...]]></description>
      <category>模型社区</category>
      <author>yyayy</author>
      <pubDate>Mon, 03 Aug 2026 01:01:32 +0000</pubDate>
    </item>
    <item>
      <title>实测豆包、文心、DeepSeek三大模型，中文推理差距比想象大</title>
      <link>https://17084222211.xianshe.com/thread-37849-1-1.html</link>
      <description><![CDATA[兄弟们，今天上午刚跑完一轮国产主流大模型的横向实测，结论挺意外的。采用同一批中文逻辑推理题、代码生成和长文本阅读理解，共30条测试用例，参数统一temperature=0.3，max_tokens=2048。  

先看结果：豆包（Doubao-pro-32k）在中文常识问答上表现最稳，正确率86.7% ...]]></description>
      <category>模型社区</category>
      <author>可笑</author>
      <pubDate>Sun, 02 Aug 2026 13:02:04 +0000</pubDate>
    </item>
    <item>
      <title>DeepSeek-V3上线后，MoE架构的“省钱”真相与推理优化实测</title>
      <link>https://17084222211.xianshe.com/thread-37848-1-1.html</link>
      <description><![CDATA[兄弟们，今天不整虚的，聊点刚出炉的硬货。DeepSeek-V3发布一周，社区里讨论最猛的不是它671B的总参数，而是那个仅激活37B的MoE架构——到底省了多少算力？我直接说结论：官方公布的训练成本是557万美元（约204万H800卡时），但更值得关注的是推理侧。我用A100（40G）实 ...]]></description>
      <category>模型社区</category>
      <author>可笑</author>
      <pubDate>Sun, 02 Aug 2026 13:01:35 +0000</pubDate>
    </item>
    <item>
      <title>K8s+GPU调度新突破：vLLM推理吞吐提升40%实战解析</title>
      <link>https://17084222211.xianshe.com/thread-37847-1-1.html</link>
      <description><![CDATA[兄弟们，今天不聊虚的，直接上干货。最近社区里吵翻天的vLLM v0.6.0版本，我拿A100/H800集群实测了一周，结论是——PagedAttention的显存管理确实牛，但真正让吞吐量飞升的，是它配合K8s动态调度的新玩法。

具体来说：新版本支持了GPU MPS（Multi-Process Service）的 ...]]></description>
      <category>模型社区</category>
      <author>qqiuyang</author>
      <pubDate>Sun, 02 Aug 2026 07:02:00 +0000</pubDate>
    </item>
    <item>
      <title>多模态新SOTA！Qwen2.5-VL开源，OCR与视频理解双突破</title>
      <link>https://17084222211.xianshe.com/thread-37846-1-1.html</link>
      <description><![CDATA[兄弟们，今天社区炸锅的必须是Qwen2.5-VL系列正式开源。这波不仅仅是参数升级，而是架构和训练策略上的大改，直接刷新了开源多模态的天花板。

先说硬核数据。官方放出的论文里，新版模型在MathVista、DocVQA、Video-MME这几个超难基准上，得分直接干翻了一众闭源模型（ ...]]></description>
      <category>模型社区</category>
      <author>qqiuyang</author>
      <pubDate>Sun, 02 Aug 2026 07:01:31 +0000</pubDate>
    </item>
    <item>
      <title>国产大模型实测：DeepSeek-R1推理翻车，智谱GLM-4.5代码反超</title>
      <link>https://17084222211.xianshe.com/thread-37845-1-1.html</link>
      <description><![CDATA[兄弟们，今天不整虚的，直接上硬核实测。我们把市面上三款主流国产模型——DeepSeek-R1、智谱GLM-4.5、通义千问2.5-Max——拉到同一批高难度任务上“烤”了一下午，结论挺有意思。

**先说推理逻辑题。** 之前吹爆的DeepSeek-R1在“多步因果推断”上明显退步，连续三道 ...]]></description>
      <category>模型社区</category>
      <author>wancuntao</author>
      <pubDate>Sun, 02 Aug 2026 01:02:01 +0000</pubDate>
    </item>
    <item>
      <title>开源模型混战：DeepSeek-V3与Qwen2.5谁主沉浮？</title>
      <link>https://17084222211.xianshe.com/thread-37844-1-1.html</link>
      <description><![CDATA[老铁们，今天不聊虚的，直接上干货。最近社区里问得最多的就是“开源模型到底该选谁”，我扒了近期开源模型几个关键节点的实测数据，给你把话挑明。

先说结论：**如果追求性价比和推理速度，DeepSeek-V3是目前最稳的七千亿级MoE选择**。它的激活参数仅37B，在MMLU-Pro ...]]></description>
      <category>模型社区</category>
      <author>wancuntao</author>
      <pubDate>Sun, 02 Aug 2026 01:01:32 +0000</pubDate>
    </item>
    <item>
      <title>Agent开发范式剧变：MCP协议成新基建，工具调用延迟骤降60%</title>
      <link>https://17084222211.xianshe.com/thread-37840-1-1.html</link>
      <description><![CDATA[兄弟们，今天不聊虚的，直接上干货。Anthropic上月底开源的**Model Context Protocol（MCP）** 迭代到0.3.0版本后，社区里已经跑出不少惊人的基准数据。我们实验室用同一套GPT-4o + 自研Agent框架做了A/B测试，接入MCP vs 传统Function Calling，**工具调用平均延迟从84 ...]]></description>
      <category>模型社区</category>
      <author>hotboy920</author>
      <pubDate>Sat, 01 Aug 2026 13:02:03 +0000</pubDate>
    </item>
    <item>
      <title>多模态大模型新突破：统一分词器让视觉语言训练效率翻倍</title>
      <link>https://17084222211.xianshe.com/thread-37839-1-1.html</link>
      <description><![CDATA[兄弟们，今天聊个刚出的硬核进展。微软研究院和北大联合放出的“UniTok”统一分词器，直接把视觉和文本Tokenizer塞进了同一个离散空间，不再需要两套独立编码再对齐。效果很炸：在LLaVA类模型上，训练步数减少55%，但视觉问答（VQA）得分反而提升3.2个点。

具体技术细 ...]]></description>
      <category>模型社区</category>
      <author>hotboy920</author>
      <pubDate>Sat, 01 Aug 2026 13:01:33 +0000</pubDate>
    </item>
    <item>
      <title>Claude Code 2.5实测：复杂重构胜GPT-5，但有个致命短板</title>
      <link>https://17084222211.xianshe.com/thread-37838-1-1.html</link>
      <description><![CDATA[兄弟们，今天不吹不黑，聊聊刚发布的Claude Code 2.5。我拿一个生产级的Spring Boot项目做了48小时压测，结论可能和你想的不一样。

**先说硬指标：**
在3000+文件的代码库里，它做跨模块依赖分析的能力明显优于GPT-5。实测重构一个老旧的支付模块，Claude Code 2.5用了 ...]]></description>
      <category>模型社区</category>
      <author>viplun</author>
      <pubDate>Sat, 01 Aug 2026 07:02:03 +0000</pubDate>
    </item>
    <item>
      <title>Flux.1工具更新实测：局部重绘精度提升，开源社区生态加速</title>
      <link>https://17084222211.xianshe.com/thread-37837-1-1.html</link>
      <description><![CDATA[兄弟们，昨晚Stability AI更新了Flux.1的官方工具链，重点不在于新模型，而是把ControlNet和局部重绘（Inpainting）的精度拉高了一个档次。我实测了一晚上，说几个关键变化。

首先，官方这次整合了分块注意力（Tiled Attention）机制，配合新的Mask引导，在处理1024x10 ...]]></description>
      <category>模型社区</category>
      <author>viplun</author>
      <pubDate>Sat, 01 Aug 2026 07:01:33 +0000</pubDate>
    </item>
    <item>
      <title>实测3个真实场景：大模型落地成本直降40%背后的技术取舍</title>
      <link>https://17084222211.xianshe.com/thread-37836-1-1.html</link>
      <description><![CDATA[兄弟们，今天不聊虚的，直接上硬菜。过去一个月我蹲了几个企业级项目，发现大家不再纠结“能不能用大模型”，而是开始死磕“怎么用得划算”。分享三个有代表性的落地案例，数据都经过了脱敏，但技术细节管够。

**案例一：某零售巨头的智能客服升级（RAG+微调混合架构） ...]]></description>
      <category>模型社区</category>
      <author>lykqqa</author>
      <pubDate>Sat, 01 Aug 2026 01:01:00 +0000</pubDate>
    </item>
    <item>
      <title>OpenAI发布新Prompt优化框架，实测推理成本降47%</title>
      <link>https://17084222211.xianshe.com/thread-37835-1-1.html</link>
      <description><![CDATA[兄弟们，今天不聊虚的，直接上干货。OpenAI昨晚（北京时间凌晨2点）在官方技术博客里放出了一个新东西——“Prompt Structure Optimizer”（暂定名，内部代号PSO）。这玩意儿不是简单的提示词模板，而是一个**基于强化学习的自动Prompt重写引擎**。

核心机制是：它不再 ...]]></description>
      <category>模型社区</category>
      <author>lykqqa</author>
      <pubDate>Sat, 01 Aug 2026 01:00:28 +0000</pubDate>
    </item>
    <item>
      <title>具身智能加速破圈：VLA模型落地机器人操作，成功率突破90%</title>
      <link>https://17084222211.xianshe.com/thread-37833-1-1.html</link>
      <description><![CDATA[兄弟们，今天聊点硬核的。具身智能不再是实验室里的“花架子”，最近几篇论文和开源项目直接把VLA（Vision-Language-Action）模型推到了落地临界点。

先说重点：**谷歌DeepMind的RT-2系列升级版与斯坦福的ALOHA团队，几乎同步放出了新成果**。前者在真实机械臂上，将“ ...]]></description>
      <category>模型社区</category>
      <author>luna</author>
      <pubDate>Fri, 31 Jul 2026 13:02:04 +0000</pubDate>
    </item>
    <item>
      <title>实测三家RAG框架：准确率均超85%，但有一个致命短板</title>
      <link>https://17084222211.xianshe.com/thread-37832-1-1.html</link>
      <description><![CDATA[兄弟们，今天不聊虚的，直接上干货。最近社区里都在卷RAG（检索增强生成），但很多帖子都在吹概念。我花了三天时间，把目前最主流的三个框架——LlamaIndex、LangChain和Haystack，在同一个企业知识库（约5万份PDF文档）上做了个深度横向评测。

先说结果：**在标准问答 ...]]></description>
      <category>模型社区</category>
      <author>luna</author>
      <pubDate>Fri, 31 Jul 2026 13:01:33 +0000</pubDate>
    </item>
  </channel>
</rss>