将强化学习重新引入 RLHF我们很高兴在 TRL 中介绍 RLOO (REINFORCE Leave One-Out) 训练器。作为一种替代 PPO 的方法,RLOO 是一种新的在线 RLHF 训练算法,旨在使其更易于访问和实施...AI 技术文章# RLHF# 强化学习2年前02570
在 Hub 上使用 Presidio 进行自动 PII 检测实验我们在 Hugging Face Hub 上托管的机器学习 (ML) 数据集中发现了一个引人关注的现象: 包含个人未经记录的私密信息。这一现象为机器学习从业者带来了一些特殊挑战。 在本篇博客中,我们将...AI 技术文章# Hugging Face Hub# PII检测# Presidio2年前02520
将 LLMs 精调至 1.58 比特: 使极端量化变简单随着大语言模型 (LLMs) 规模和复杂性的增长,寻找减少它们的计算和能耗的方法已成为一个关键挑战。一种流行的解决方案是量化,其中参数的精度从标准的 16 位浮点 (FP16) 或 32 位浮点 (F...AI 技术文章2年前02510
为视觉语言多模态模型进行偏好优化为视觉语言多模态模型进行偏好优化 训练模型使得它能够理解并预测人类偏好是一项比较复杂的任务。诸如 SFT (Supervised finetuning) 的传统的方法一般都需要耗费较大成本,因为这些算...AI 技术文章# DPO# TRL# VLM2年前02470
英特尔 Gaudi 加速辅助生成随着模型规模的增长,生成式人工智能的实现需要大量的推理资源。这不仅增加了每次生成的成本,而且还增加了用于满足此类请求的功耗。因此,文本生成的推理优化对于降低延迟、基础设施成本以及功耗都至关重要,其可以...AI 技术文章# Gaudi# 辅助生成2年前02460
什么是 3D|Hugging Face 3D 机器学习课Hugging Face 3D 机器学习课发布啦! 在本课程中,你将学习到: 当前 3D 机器学习的总体情况 近期发展的重要性 如何自己动手制作生成式 3D 演示 课程当前有 4 个短视频。由Hugg...AI 视频教程# 3D# Hugging Face2年前02440
欢迎 Stable Diffusion 3.5 Large 加入 🧨 Diffusers作为 Stable Diffusion 3 的改进版本,Stable Diffusion 3.5 如今已在 Hugging Face Hub 中可用,并可以直接使用 🧨 Diffusers 中的代码运...AI 技术文章# Diffusers# Stable Diffusion2年前02430
XetHub 加入 Hugging Face!我们非常激动地正式宣布,Hugging Face 已收购 XetHub 🔥 XetHub 是一家位于西雅图的公司,由 Yucheng Low、Ajit Banerjee 和 Rajat Arya 创立...AI 技术文章# Hugging Face# XetHub2年前02420
Halo 正式开源: 使用可穿戴设备进行开源健康追踪在飞速发展的可穿戴技术领域,我们正处于一个十字路口。市场上充斥着各式时尚、功能丰富的设备,声称能够彻底改变我们对健康和健身的方式。然而,在这些光鲜的外观和营销宣传背后,隐藏着一个令人担忧的现实:大多数...AI 技术文章# 健康追踪# 开源2年前02410
Gradio 5 稳定版正式发布在过去的几个月里,我们一直在努力工作,今天,我们想向大家展示成果:Gradio 5 稳定版现已发布。 有了 Gradio 5,开发者可以构建 生产级的机器学习 Web 应用,这些应用不仅性能优越、可扩...AI 技术文章# Gradio 52年前02410