https://linux.do 论坛的话题更新通知频道。
@M1n9X 在 一种检查特定 API 模型是否为原始官方模型的技术方案 中发帖
最近看到一篇论文 [2603.01919v2] Real Money, Fake Models: Deceptive Model Claims in Shadow APIs
里面介绍了几种方案来检查特定 API 的模型是否为原始官方模型。
主动指纹识别检测,使用开箱即用的 LLMmap 框架:
原理:LLMmap 是一个主动指纹识别框架。它的核心原理是通过向模型发送一组精心设计的查询集,分析模型的输出特征,并计算其与参考数据库中官方模型输出的余弦距离 (Cosine Distance),从而精准分类并识别模型的真实身份。
自行检测标准:论文建议使用至少 24 个探针向端点发起查询。如果计算出的余弦距离超过官方基准的 1.2倍,或者框架识别出的 Top-1 模型与 API 宣称的模型不符,则可以直接判定该 API 存在欺骗行为。
统计学分布检测,使用开箱即用的 MET (模...
帅帅 (@shuaishuai1) 在 佬友们boss上找到一个远程不知道该不该辞掉现在的工作去做 中发帖
下图是该岗位的详细信息
[image]
[image]
[image]
[image]
[image]
[image]
[image]
不知道要不要去,薪资我谈到了13,但是时间有点阴间,同时试用六个月还不会缴纳社保这些。不知道有没有坑。希望老友们给一点参考意见谢谢
verdict 在 opus对比codex的一些见解 中发帖
这两个我结合使用高强度体验下来,我发现opus对于问题的发现在局部可以非常细,但是对于大局观没有codex好,
对于codex提出的审查意见,我交给opus分析后,基本都认,claude对于codex的评价是深度比自己列出的问题高,自己则是局部细节更多.
对于opus提出的审查意见,我交给codex分析后,大概有三成codex是不认可的.
codex比较会偷懒,总是分析大概给出不超过10个问题后就给出结果了,但是claude一次性会给出尽量多的问题,虽然codex给出的问题少,但是问题深度总体比opus的高,这是opus自己评价的,所以我都是让opus帮我分析更多的问题,然后交给codex查看是否认同,结合两份清单,交给codex来写,极少翻车
stevessr backup 在 也许人只是需要温暖? 中发帖
也许你只是需要一个温暖的对象?[1]
[image]
人会感觉自己一世无成吗?
[image]
[image]
[HEAj9heaEAEYsJ6]
[image]
[HD_wxgfa8AABbCl]
[image]
[image]
[image]
[image]
[image]
[image]
[image]
[image]
[image]
[image]
怎么又是她……
[image]
[image]
[image]
[image]
[image]
[image]
怎么还有实习的诱惑
[image]
[image]
[image]
[image]
[image]
[image]
[image]
[image]
[image]
[ima...
该账号已封禁 (@Qllama) 在 亲戚朋友问你们关于小龙虾,你们都是怎么回复的? 中发帖
最近好几个从来不碰电脑的朋友问我小龙虾
都被小龙虾的热度吸引了,问我可以干嘛,能不能让小龙虾来赚钱啥的(水文没少看)
你们遇到了吗?都咋回复的。。。我都让他们好好用豆包。。。我觉得豆包对大多数人是够了。😂
@Samiya_Z 在 关于safety模型的一些,也许算是猜测?乱七八糟 中发帖
我突然想到就是一个科学预测是Kurzweil一派的未来学预测,大概就是“2045年会迎来科技奇点”。
我想是不是因为越来越多人觉得强AI可能来得比以前想的更快,先进AI可能在不太长的时间内跨过一些关键能力阈值,而且风险不能等到最后再处理,所以拼命提前加强safety;至于为了公司不赔钱只是其中一小部分原因。
2025年的 International AI Safety Report 总结:通用AI能力近年进展很快,未来进展可能从慢到极快都有可能,而政策制定者面临的难点恰恰是进展快且不完全可预测
我自己是把AI会自己学习升级分为4个层级:
自己改自己的答案。像Self-Refine这类方法,就是模型先给答案,再自己批改、再重写,很多任务上能提升输出质量。
在规则明确的环境里自己练出来。AlphaZero我认为就是就是一个经典例子,因为它主要靠自self-play从零开始...
@kzhsw 在 硬件涨价会不会促进软件性能优化? 中发帖
在硬件高速发展的时期, Andy and Bill’s law主导了软件开发,要业务不要性能,但随着硬件涨价,用户是否会更多的转向软件性能优化?
例如,对商业软件:
硬件涨价 → 硬件采购更新计划减少 → 性能不足 → 采购性能更好的软件
但考虑到成本问题,似乎软件的成本更贵 🙃
对bloatware或许有更多动力优化,高性能 → 同时展示更多的bloat?
摹本易写 (@k999458) 在 不是哥们 就1分钟啊 A\! 中发帖
[Screenshot_2026-03-23-12-33-05-96_e307a3f9df9f380ebaf106e1dc980bb6]
苏哥拉弟 (@sugrady) 在 通过这个任务有被ai震惊到 中发帖
第一次通过这一个小任务能明显感受到🦞的恐怖生产力,就直接跳过思考,刚说完22s就完成了…
相当于我跟他说完直接秒回我,各位佬能懂那种感觉嘛🤨,下载40张图标-打包-发送给我,这个动作20多s,不到半分钟
换作以前,按理说完,他需要先去思考,规划写脚本执行下载然后打包发送给我
再换作人手动右键下载,40张图片至少得要5分钟(排除用脚本工具情况)
[88f20dae4d7fd7af670dfdbcbf2a6d1c]
[7feb77887a9aab95f7838494afed6a7b]
胖阿学 (@axue_cn) 在 Any爱你不容易,是时候说再见了~ 中发帖
首先十分感谢any的大佬,差不多两个月any一直是我的主力key,几乎伴随着我的整个智能编程的学习过程,让我从小白进阶为现在可以做点事了,所以十分感谢any给我们提供学习机会。然后差不多两个月前我的账号无缘由的被封了,辛苦签到的近3000刀没了,没地方申诉。后来群里的佬友解惑可能是用了教育邮箱的原因,虽然很无奈但也只能认了。之后开始使用L账号注册,小心翼翼,每日上班第一件事就是签到,截至今天早上差不多又到1100刀,期间作为备用花了100多左右。然后转折来了,今天上午cursor不稳定,想切到any用cc,刚开始一直未通,快到11点半的时候好不容易通了,然后告诉我封号了。截至当前我已没有任何途径能再注册any了,时候说再见了。
最后提个小希望哈,希望any的大佬能在首页加个网站使用公约哈