DeepSeek-Coder-V3悄然登顶,代码生成迎来国产新王?
兄弟们,昨儿个刷榜单,发现一个事儿——DeepSeek-Coder-V3在SWE-bench Verified上干到了78.9%的通过率,直接把GPT-4o(75.2%)和Claude 3.5 Sonnet(76.1%)甩在了身后。这还没完,在HumanEval-Mul上,它的多语言能力也碾压了同量级的Qwen2.5-Coder-32B。先说点实在的。这次V3的架构改动不小,把原来的GQA换成了MLA(Multi-head Latent Attention),推理显存直接砍半,我用8张A100跑个中等仓库的代码补全,首token延迟比上一代降了40%左右。关键是它对长上下文的支持提到了128K,这意味着可以直接把整个项目的结构灌进去让它改bug,不用再手动拆文件喂。
再说个接地气的场景:我拿一个内部遗留的Java Spring项目试了试,让它从Controller层一路生成到Mapper XML,一次通过率达到55%。作为对比,用GPT-4o大概只有三四成。虽然复杂业务逻辑还是得人来兜底,但写CRUD、单测、DTO转换这些脏活累活,确实可以放心交给它了。
特别提醒一句,如果你在用Cline或Continue这类IDE插件,记得把base_url切到DeepSeek的端点,prompt模板不用大改,但system prompt里建议加上“偏好使用Java 17+和Spring Boot 3.x”这种项目约束,效果会明显更好。
模型权重已经在HuggingFace开源了(MIT协议),量化版也有人在搞。想本地跑的,最低建议32G显存起步,4bit量化下勉强能塞进4090。这块的性能曲线和成本账,值得单独开一帖细聊,回帖过50我写个压力测试对比。
页:
[1]