LocateAnything
互联网
2026-07-01 14:37:06
LocateAnything是英伟达推出的视觉语言定位模型,基于并行框解码技术,用户输入自然语言即可在图像中精准框选目标。模型支持多目标检测、GUI定位、OCR文本检测和点级指向等任务,推理速度达12.7 BPS(H100),较Qwen3-VL快10倍,在LVIS等基准达SOTA,适用机器人、文档智能与自动驾驶场景。



![一只喵喵梓[紧急企划] NO.003](https://imgs.knowsafe.com:8087/img/aideep/2022/11/27/a6c59ea73692b584aa37a1d154861d76.jpg?w=250)



