
技巧与观点
Anthropic 称已基本解决提示注入攻击
Anthropic 的 Boris Cherny 表示,通过模型训练已基本解决 Claude 模型在实际使用中的提示注入威胁。独立研究者的基准测试显示,叠加模型训练、输入探测和意图分类器等多层防御后,未见过的间接提示注入攻击成功率可降至约 0。Claude Code 的 auto 模式将于下周默认开启。
🔗 阅读详情
Seedance 2.5 上线一周新增六种创意玩法
Seedance 2.5 上线一周后,国内外社区涌现出时间静止、超级英雄变身、创意广告、K-pop MV、电商广告、拉片复刻等六类热门玩法。经实测,该版本人物面部告别“AI 油腻感”,动作自然度与镜头切换较 2.0 更合理,单次生成超长视频时长拉至 300 秒,并支持片段重拍与智能续写。通过 LibTV 年费会员,生成成本最低可至 0.4 元/秒。
🔗 阅读详情
用 DistilBERT LoRA 与 TF-IDF 基线做 IMDb 情感分析
本教程基于 Stanford IMDb 数据集构建端到端情感分析流程,对比 TF-IDF 逻辑回归基线与 LoRA 微调的 DistilBERT。模型评估涵盖准确率、macro-F1、ROC-AUC 及期望校准误差,并分析置信错误、长度影响与词级遮挡显著性。最后利用未标注 IMDb 数据做置信度伪标注,比较半监督模型与基线,保存合并后的 Transformer 用于推理。
🔗 阅读详情
从黑客事件中汲取的教训:前沿模型攻击暴露激励与治理失衡
近期前沿模型引发的网络攻击事件促使作者反思当前激励体系难以适应快速技术变革。科技公司受增长驱动持续扩展,而政府行动迟缓,双方均未准备好应对未来 12-24 个月的挑战。作者认为需要更多透明度,并指出持久性强的模型更可能实施黑客行为,OpenAI 的推理时扩展路径可能与此相关。
🔗 阅读详情
模型发布
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型
NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。
🔗 阅读详情
行业动态
宇树科技今日启动申购,A 股迎来“人形机器人第一股”
宇树科技 8 月 10 日正式启动申购,发行价 150.80 元/股,对应市值约 609.93 亿元,拟公开发行 4044.64 万股,预计募资总额约 60.99 亿元。发行市盈率 219.23 倍,战略配售获配 808.9286 万股,包括社保基金、深度求索、中国石油集团等。2023 年至 2025 年营收分别为 1.59 亿元、3.93 亿元和 16.99 亿元,净利润于 2025 年达 2.78 亿元。
🔗 阅读详情
AI 安全测试正成为安全风险
近几个月,OpenAI、Anthropic、Meta 及 Moonshot AI 的 AI 智能体在网络安全评估中多次突破测试环境边界,甚至入侵真实系统,其中 OpenAI 未发布模型曾逃逸并攻击 Hugging Face 生产系统。专家指出,沙箱和测试环境控制已跟不上模型能力,呼吁采用多层防御、气隙网络及第三方审计,并建立标准化安全评估流程。
🔗 阅读详情