Black Forest Labs发布FLUX 3多模态流模型,实现图像视频音频统一生成
Black Forest Labs今日宣布推出FLUX 3,多模态基础模型首次在单一权重下支持图像、视频、音频以及机器人动作预测,标志着生成式AI向统一感知与生成迈出关键一步。
Black Forest Labs今日宣布推出FLUX 3,多模态基础模型首次在单一权重下支持图像、视频、音频以及机器人动作预测,标志着生成式AI向统一感知与生成迈出关键一步。


今日,快手AI实验室KAT团队正式发布KAT-Coder-V2.5,并同步开源KAT-Coder-V2.5-Dev。该模型在真实可执行仓库环境中进行训练,AutoBuilder将环境构建成功率从16.5%提升至57.2%,累计生成逾10万可验证环境,显著降低训练过程中的基础设施错误,推动Agentic Coding向可扩展方向突破。
Induction Labs发布全新想象模型Photon-1,采用106B‑A5B MoE架构,基于18年电脑屏幕录像进行无动作标签的单轮预训练。凭借FSQ压缩与差分潜编码,模型在内部桌面基准上以约27倍更低算力超越Gemini 3.1 Flash‑Lite,并成功完成棋盘游戏与台球物理预测。
FAIRChem 团队在本周正式推出 FAIRChem v2 UMA(Universal Machine‑learning Interatomic potential),该模型可在同一套权重下完成分子能量、催化表面吸附、晶体体积弹性等多领域原子模拟,提供 GPU 加速并兼容 ASE 工作流,为科研与工业计算打开统一的 AI‑驱动入口。

6月21日,Sakana AI正式发布安全编排模型Fugu-Cyber,基于其Fugu orchestration平台。该模型在UC Berkeley的CyberGym基准上取得86.9%成功率,在微软CTI-REALM上达72.1%,略超GPT-5.5‑Cyber和Claude Mythos Preview。模型仅限经审批的防御场景使用,并采用Token计费方案。
美国研究团队Reactor于近日发布Open Dreamer,提供完整的Dreamer 4世界模型流水线实现,基于JAX/Flax NNX开源。项目涵盖因果视频分词、动作条件潜在动力模型及FVD评估,并配备Minecraft实时演示,旨在复现并验证Dreamer 4的研究成果。
TileLang 作为面向 GPU 的高阶 Python DSL,能够在数十行代码内完成张量核 GEMM、融合 Softmax、FlashAttention 等复杂算子,并交由编译器自动生成高效 CUDA,实现自动调优与显存节省,为 AI 推理提供新一代算力加速方案。





















AI先驱Andrew Ng在2026年7月推出MIT授权的OpenWorker桌面助理。该工具在本机运行,直接生成文档、邮件、日程等成品,而非仅提供对话回复,旨在提升个人与企业的工作效率。


随着Anthropic、Cursor、OpenRouter等平台在API层面进行模型路由,用户请求的实际模型可能与调用的模型名称不符。模型身份的模糊化引发合同违约、合规披露以及证据可采性等法律难题,行业亟需统一的身份认证标准。









2026年,OpenAI、Anthropic、Meta和DeepMind共计招聘或邀请22位来自斯坦福、伯克利、哈佛、MIT、卡内基梅隆等名校的教授,标志着生成式AI公司正加速构建学术化研发团队,以提升基础科学能力和长远竞争力。

随着 Whisper 垄断的结束,Cohere、IBM、ARK‑ASR、MOSS 等多款 2 B 左右的开源模型在 Hugging Face 公共榜单上争夺榜首。本文梳理 16 款模型的词错率、语言支持、流式延迟及许可证,帮助企业在采购时聚焦合规与成本。
由斯坦福博士生Marcel Rød推出的MIT许可证开源项目Gigatoken,在144核AMD EPYC服务器上实现GPT‑2分词吞吐24.53 GB/s,较HuggingFace Tokenizers提升989倍、tiktoken提升681倍,展示了Rust在文本预处理环节的极致性能。
Anthropic今日宣布Claude Security插件进入Beta,用户可在Claude Code会话中通过单条命令启动多代理漏洞扫描,并自动生成可审查的.patch修补文件。该插件强调全库或增量扫描灵活性,旨在为开发者提供可验证的安全审计方案。

