https://linux.do 论坛的话题更新通知频道。
小夜 (@xiaoye6688) 在 杭州现在的太阳好红!!! 中发帖
[c43eee4f94e8cab29b4da006bad253fd]
[db3f355cb8fc33a6cd7c6b6d7b254fad]
@hsiaoshwai 在 免费麦当劳麦辣鸡腿堡 任意消费20元使用 中发帖
免费麦当劳麦辣鸡腿堡 任意消费20元使用
这个活动大家可以免费领取一下哦
任意消费20元可以随单一起使用,7天有效期
微信打开下方地址 领30万份麦辣鸡腿堡
#小程序://麦当劳/j1mqz67g7iG4mYw
口令:A或B或C 任意一个字母
[c99fc559b04fccad7083bbdaedde9cd1]
你这是违法行为 (@Anano) 在 模型自称Claude不等于蒸馏,1000条回答就能让Qwen认错自己! 中发帖
研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。
训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。
Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。
为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不...
慕鸢 (@user792) 在 【蓝色大肥鱼竟敢吃白饭】 中发帖
ds v4没发布时:金融吸血鬼的谎言泡沫即将破裂
v4 预览版发布时:deepseek的新一代大模型发布,但代价是什么?
v4 预览版承认由于gpu产能导致现在自己价格虚高时:一颗新星正在冉冉升起
v4 预览版打二五折时:开源界的英雄正在拯救闭源的黑暗ai界
v4预览版宣布命中缓存输入打1折时:德技双馨的老企业家梁文峰再攀高峰
v4预览版宣布25折永久保留时:伟大的梁圣和他的大赢鲸莅临ai界
v4 正式版迟迟不出时:爱梁,信梁,等梁
v4宣布涨价:蓝色大肥鱼竟敢吃白饭,
v4正式版跳票:小难梁掏不出大赢鲸
ds官方未就跳票做出解释:大wait die梁子重新定义七月中旬,ds的神话还能持续多久?
gpt luna降价:新一代斩杀线正清算被背信弃义的伪朝
v4 flash 0731发布:亿万鲸子清算!对所有AI企业后门进行深度求索!
你这是违法行为 (@Anano) 在 推理引擎WASTE开源:把Kimi K3完整跑进64GB MacBook 中发帖
边缘数据库公司 SQLite AI 开源推理引擎 WASTE。它让保留全部层和专家的 Kimi K3,能在一台 64GB MacBook Pro 上运行。转换后的模型约占 1TB,速度为每秒 0.49 至 0.54 个 Token。
WASTE 把约 27GB 的模型主干留在内存。8 万多个专家放在内置 SSD。每生成一个 Token,只从硬盘读取当前调用的专家。
这个版本没有蒸馏、裁剪或删除专家。WASTE 将原本采用 MXFP4 的专家权重重新量化到 3-bit,并把模型主干压成 4-bit 和 8-bit。
[image]
会飞的蹦蹦 (@hupc) 在 DeepSeek Flash V4正式版在CC中无敌好用啊 中发帖
今天正式版出来后,就用官方API接入cc中开始干活,不到4个小时 ,差不多消耗了1亿token,缓存命中率竟然达到了99%
关键是干活质量还不错,很少返工
真不错 😊
[image]
LLMeme 在 DeepSeek V4 Flash 顶破 GPT-5.6 Luna 直观示意图 中发帖
今天凌晨,Sam Altman 兴奋地宣布了 GPT-5.6 Luna 降价,给出了这张图:
[IMG_1798]
后来的事情大家也知道了, Artificial Analysis 给
DeepSeek V4 Flash 0731 最新的评测结果是:
[image]
所以,如果把这个结果叠到 Sam Altman 的原图上,就会得到:
[model-evolution-annotated-python]
因为原 X 还有网友指出 Sam Altman 有意无意漏了一些模型,我顺便也加了几个。
顺便一提,我试图直接在 ChatGPT 合成上面这张图,结果要返工好几次才能生成 DeepSeek 顶破 GPT 的结果,也是醉了(最后为了准确,要求写 Python 制作图片)
[eb6eddb5-1be5-4bff-96a9-c8402a934684]
FadingSoul (@1326555262) 在 佬们,目前最稳定的Opus4.5渠道是什么 中发帖
目前只想和Opus4.5聊天(感觉4.6有点性冷淡。。。),不写代码,有无稳定方法?目前貌似只有cursor稳定了吧,但感觉额度好少,性价比好低。官方太容易封号了。佬们有推荐渠道吗
𝓵𝓮𝔃𝓲𝓼𝓱𝓮𝓷 (@lezishen) 在 美国考虑对毕业后想工作的外国学生收取10万美元费用 中发帖
[image]
[image]
[image]
https://www.wsj.com/politics/policy/u-s-weighs-100-000-fee-for-foreign-students-wanting-to-work-after-graduation-d0bf43d9
Marisa (@marisa4219) 在 现在用DSV4F写代码的感觉就是一个字 快! 中发帖
🤣 一直在用sol或火山的glm5.2 这俩都跟便秘式的喜欢雷霆大思考 有时候甚至能卡十几分钟
现在用dsv4f 就是一个字 爽 🤣 太快了 真的是太快了 快又准 把话说明白 指哪打哪
梁圣 快把pro端出来啊 🫠
quan (@krzz2q) 在 调用deepseek-v4-flash官方api、推理强度 max 时遇到 APIConnectionError 中发帖
我在调用 DeepSeek API 时,使用模型 deepseek-v4-flash、推理强度 max,经常会遇到 APIConnectionError: Connection error.。佬友们遇到过类似问题吗?