需求人群
该模型适合研究人员、开发者以及需要处理视觉语言任务的企业,尤其是那些需要多语言支持和高性能模型的用户。
使用场景
在 Cohere Playground 中使用 Aya Vision 32B 进行图像描述通过 Hugging Face Space 与模型进行交互式对话使用模型进行多语言的 OCR 任务
产品特色
支持 23 种语言,覆盖多种语言场景能够处理图像输入并生成文本输出支持 16K 上下文长度,适合复杂任务提供交互式体验,如 Cohere Playground 和 Hugging Face Space可通过 WhatsApp 与模型进行聊天交互
使用教程
1安装必要的 transformers 库:`pip install 'git+https://github.com/huggingface/transformers.git@v4.49.0-AyaVision'`2加载模型和处理器:`AutoProcessor.from_pretrained(model_id)` 和 `AutoModelForImageTextToText.from_pretrained(model_id)`3准备输入数据,包括图像和文本内容4使用 `processor.apply_chat_template` 方法格式化输入数据5调用模型的 `generate` 方法生成输出文本