Skill Claude CodeCodex
Vision-language pre-training framework bridging frozen image encoders and LLMs. Use when you need image captioning, visual question answering, image-text retrieval, or multimodal chat with state-of...
2 3d ago A 45 tokens
original MIT