SmolVLA: 让机器人更懂 “看听说做” 的轻量化解决方案🧭 TL;DR 今天,我们介绍了 SmolVLA,这是一个轻量级 (450M 参数) 的开源视觉 - 语言 - 动作 (VLA) 模型,专为机器人领域设计,并且可以在消费级硬件上运行。 仅使用开源社区...AI 技术文章# VLA# 机器人1年前0140
Codex 正在推动开源 AI 模型的训练与发布继我们使用 Claude Code 训练开源模型的项目之后,现在我们更进一步,将 Codex 引入这一流程。这里的重点不是“Codex 自己开源模型”,而是让 Codex 作为编码代理,参与并自动化开...AI 技术文章# Codex# 开源AI模型8个月前0120
经同意的语音克隆在这篇博客文章中,我们介绍了“语音同意验证机制 (voice consent gate)”的概念,支持通过明确同意来进行语音克隆。我们还提供了一个 示例 Space 应用 和 相关代码,帮助大家快速上...AI 技术文章# 语音克隆8个月前0120
开源人工智能:数字主权的基石随着人工智能正在重塑从教育到国防的方方面面,数字主权已不再是一个长期的愿景,而是一个迫在眉睫的现实需求。 为了确保各国能够对影响其社会的人工智能系统进行治理、审核和建设,开源人工智能正成为实现自主可控...AI 技术文章# 人工智能# 开源# 数字主权1年前0120
Hugging Face 论文页面功能指南在飞速变化的研究世界中,紧跟最新进展至关重要。为帮助开发者与研究人员把握 人工智能 前沿动态,我们推出了 Daily Papers 页面。自上线以来,Daily Papers 已收录超过 1 万 篇由...AI 技术文章# Daily Papers8个月前0110
用开源模型强化你的 OCR 工作流我们在这篇文章中新增了 Chandra 和 OlmOCR-2,并附上了它们在 OlmOCR 基准上的得分 🫡 摘要: 强大的视觉语言模型 (Vision-Language Models, VLMs) ...AI 技术文章# OCR# 开源模型8个月前0100
流式数据集:效率提升 100 倍!快速了解(TLDR) 现在只需一行代码,就能通过 load_dataset('dataset', streaming=True) 以流式方式加载数据集,无需下载! 无需复杂配置、不...AI 技术文章# Datasets# 数据集8个月前070
欢迎 GPT OSS —— 来自 OpenAI 的全新开放模型家族!欢迎 GPT OSS —— 来自 OpenAI 的全新开放模型家族! GPT OSS 是 OpenAI 推出的 重量级开放模型,面向强推理、智能体任务以及多样化开发场景。该系列包含两款模型:拥有 11...AI 技术文章1年前070
nanoVLM: 最简洁、最轻量的纯 PyTorch 视觉-语言模型训练代码库nanoVLM 是使用纯 PyTorch 训练 你自己的视觉语言模型 (VLM) 的 最简单 方式。它是一个轻量级 工具包 ,让你可以在 免费的 Colab Notebook 上启动 VLM 训练。 ...AI 技术文章# nanoVLM# PyTorch# VLM1年前070
用 AI Sheets 解锁图像的力量🧭简要概览:Hugging Face AI Sheets 是一款开源工具,能够用 AI 模型增强数据集的处理能力,无需编写任何代码。现在新增视觉功能:可以从图像 (如收据、文档) 中提取数据、根据文本...AI 技术文章# AI 图像# HuggingFace9个月前060