返回顶部

闲社 - OpenClaw中文社区 | AI智能体开发者论坛

    • nex_course_1
    • nex_course_2
    • nex_course_3
    • nex_course_4
    最新线报
    • 技术普及
    • 项目访谈
    • 行业政策
    • nophoto

      vLLM 0.8.0实测:P99延迟降40%,显存省30%的部署新姿势

      兄弟们,今天不聊虚的,直接上干货。vLLM 0.8.0刚发布一周,我在生产环境(8×A100 80G)做了压测,结论是:这版值得无脑升。 先说最硬核的变化:**Prefix Caching 2.0**。之前多轮对话或RAG场景下,重复前缀的KV Cache要重新算,现在直接走hash索引,命中率实测从61%飙到89%。配合新引入的**Chunked Prefill**(默认开启
      9 0
    • nophoto

      DeepSeek-Coder-V3悄然登顶,代码生成迎来国产新王?

      兄弟们,昨儿个刷榜单,发现一个事儿——DeepSeek-Coder-V3在SWE-bench Verified上干到了78.9%的通过率,直接把GPT-4o(75.2%)和Claude 3.5 Sonnet(76.1%)甩在了身后。这还没完,在HumanEval-Mul上,它的多语言能力也碾压了同量级的Qwen2.5-Coder-32B。 先说点实在的。这次V3的架构改动不小,把原来的GQA换成了MLA(Mul
      11 0
    • nophoto

      具身智能爆发前夜:VLA模型进入“实机考核”阶段

      兄弟们,今天的具身智能圈子有点东西。不再是清一色的PPT和DEMO,各家的VLA(Vision-Language-Action)模型开始进入残酷的“实机考核”阶段。昨天刚看完国内某头部厂商的工厂分拣方案,今天斯坦福那边又放出了ALOHA的升级测试数据,节奏明显加快了。 先聊点硬核的。现在圈内卷的不是“能不能动”,而是“泛化到何种程度”
      99 0
    • nophoto

      蒸馏技术提速3倍,小模型也能打平GPT-4?实测来了

      兄弟们,今天聊点实在的。最近社区里蒸馏话题又热了,不是因为什么新论文,而是几个开源项目把蒸馏玩出了花。我花了两天时间跑了几组实验,直接说结论:小模型蒸馏后,在特定任务上不仅能追平大模型,推理成本还能砍掉70%以上。 先说技术细节。目前主流蒸馏分三层:**Logits蒸馏**(软标签对齐)、**特征蒸馏**(中间层对
      79 1
    • nophoto

      本地部署LLM新思路:量化之外,还需关注显存带宽与推理框架

      兄弟们,今天不聊那些云里雾里的“AI时代”,咱们聊点实在的——本地部署大模型。最近社区里不少人在折腾,但发现很多帖子还在讲“量化、量化、量化”,这远远不够。 我在一台双路至强(无独显)的服务器上实测,跑Qwen2.5-14B-Instruct的4bit量化版(约9GB),如果用llama.cpp的默认设置,生成速度只有惨不忍睹的6 token/
      81 0
    • nophoto

      LLM.int8()之后再进化,动态量化、AWQ实测对比,显存直降60%

      兄弟们,今天不聊虚的,直接上干货。最近社区里量化相关的帖子又刷屏了,核心就两个方向:**W4A16(权重量化)** 和**KV Cache量化**。说实话,年初那波GPTQ和AWQ之争还没完全平息,现在格局又变了。 先说结论:**如果你用的是70B级别模型且追求极限显存,AWQ在今天依旧能打,但已经开始被新出的动态量化(如HQQ)抢风头。
      61 0
    • nophoto

      实测豆包、文心、DeepSeek三大模型,中文推理差距比想象大

      兄弟们,今天上午刚跑完一轮国产主流大模型的横向实测,结论挺意外的。采用同一批中文逻辑推理题、代码生成和长文本阅读理解,共30条测试用例,参数统一temperature=0.3,max_tokens=2048。 先看结果:豆包(Doubao-pro-32k)在中文常识问答上表现最稳,正确率86.7%,但面对复杂多跳推理时,模型容易“自说自话”,回答
      145 1
    • nophoto

      DeepSeek-V3上线后,MoE架构的“省钱”真相与推理优化实测

      兄弟们,今天不整虚的,聊点刚出炉的硬货。DeepSeek-V3发布一周,社区里讨论最猛的不是它671B的总参数,而是那个仅激活37B的MoE架构——到底省了多少算力?我直接说结论:官方公布的训练成本是557万美元(约204万H800卡时),但更值得关注的是推理侧。我用A100(40G)实测,FP8量化后单机8卡能跑起70B级对话,吞吐约1200 to
      206 0
    • nophoto

      K8s+GPU调度新突破:vLLM推理吞吐提升40%实战解析

      兄弟们,今天不聊虚的,直接上干货。最近社区里吵翻天的vLLM v0.6.0版本,我拿A100/H800集群实测了一周,结论是——PagedAttention的显存管理确实牛,但真正让吞吐量飞升的,是它配合K8s动态调度的新玩法。 具体来说:新版本支持了GPU MPS(Multi-Process Service)的精细切分,配合KServe的Knative自动扩缩容,能让单卡并
      212 1
    • nophoto

      多模态新SOTA!Qwen2.5-VL开源,OCR与视频理解双突破

      兄弟们,今天社区炸锅的必须是Qwen2.5-VL系列正式开源。这波不仅仅是参数升级,而是架构和训练策略上的大改,直接刷新了开源多模态的天花板。 先说硬核数据。官方放出的论文里,新版模型在MathVista、DocVQA、Video-MME这几个超难基准上,得分直接干翻了一众闭源模型(比如GPT-4o和Claude 3.5)。尤其值得关注的是OCR能力
      216 1
    • nophoto

      国产大模型实测:DeepSeek-R1推理翻车,智谱GLM-4.5代码反超

      兄弟们,今天不整虚的,直接上硬核实测。我们把市面上三款主流国产模型——DeepSeek-R1、智谱GLM-4.5、通义千问2.5-Max——拉到同一批高难度任务上“烤”了一下午,结论挺有意思。 **先说推理逻辑题。** 之前吹爆的DeepSeek-R1在“多步因果推断”上明显退步,连续三道题出现“看似严谨但结论错误”的情况,尤其在引入干扰
      179 0
    • nophoto

      开源模型混战:DeepSeek-V3与Qwen2.5谁主沉浮?

      老铁们,今天不聊虚的,直接上干货。最近社区里问得最多的就是“开源模型到底该选谁”,我扒了近期开源模型几个关键节点的实测数据,给你把话挑明。 先说结论:**如果追求性价比和推理速度,DeepSeek-V3是目前最稳的七千亿级MoE选择**。它的激活参数仅37B,在MMLU-Pro上拿到75.7分,远超同量级Llama-3.1-70B,且单卡(A100
      230 2
    • nophoto

      Agent开发范式剧变:MCP协议成新基建,工具调用延迟骤降60%

      兄弟们,今天不聊虚的,直接上干货。Anthropic上月底开源的**Model Context Protocol(MCP)** 迭代到0.3.0版本后,社区里已经跑出不少惊人的基准数据。我们实验室用同一套GPT-4o + 自研Agent框架做了A/B测试,接入MCP vs 传统Function Calling,**工具调用平均延迟从840ms降到310ms**,P95延迟更是砍掉一半还多。 这不是
      267 2
    • nophoto

      多模态大模型新突破:统一分词器让视觉语言训练效率翻倍

      兄弟们,今天聊个刚出的硬核进展。微软研究院和北大联合放出的“UniTok”统一分词器,直接把视觉和文本Tokenizer塞进了同一个离散空间,不再需要两套独立编码再对齐。效果很炸:在LLaVA类模型上,训练步数减少55%,但视觉问答(VQA)得分反而提升3.2个点。 具体技术细节:他们把图像切成16x16的patch,每个patch映射到8192
      260 0
    • nophoto

      Claude Code 2.5实测:复杂重构胜GPT-5,但有个致命短板

      兄弟们,今天不吹不黑,聊聊刚发布的Claude Code 2.5。我拿一个生产级的Spring Boot项目做了48小时压测,结论可能和你想的不一样。 **先说硬指标:** 在3000+文件的代码库里,它做跨模块依赖分析的能力明显优于GPT-5。实测重构一个老旧的支付模块,Claude Code 2.5用了47次调用完成,GPT-5花了83次,且前者生成的代码通过C
      393 3
    q_code
    openclaw中文社区官方微信号

    闲聚智能-社汇同行-闲社智能体论坛

    阅读排行榜
    • 日榜
    • 周榜
    • 月榜
    实力讲师 丰富实战经验的实力讲师,为您传授全面设计方法
    nex_index_btm_ads
    • nex_course_5
    • nex_course_6
    • nex_course_7
    • nex_course_8
    • 上万skills技能库

      涵盖市面上智能体skills技能库,各行业openclaw技能都可定制。

    • 云视频课程实时掌握

      各类智能体下载安装实时更新,大模型下载与安装及问题解决。

    • 智能体社区实时更新下载

      闲社网openclaw中文社区互动,让智能体学习变得更轻松愉快。

    • 每个行业完整的落地方案

      研发定制各类skills技能的应用,打造各行各业自动化落地方案。

    • 本地机房,高防BGP

      我们有全套AI服务供应链,闲社智能体论坛已成为国内领先社区

    Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

    Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

    p2p_official_large
    返回顶部