# Multi-Lingual Cosine Similarity Search

**URL:** https://forum.weaviate.io/t/multi-lingual-cosine-similarity-search/1647
**Category:** Support
**Created:** [March 8, 2024, 12:29am UTC](https://forum.weaviate.io/t/multi-lingual-cosine-similarity-search/1647 "2024-03-08T00:29:06Z")
**Posts on this page:** 6
**Page:** 1

<div class="post-metadata">

### Author: ![SomebodySysop](https://yyz1.discourse-cdn.com/flex027/user_avatar/forum.weaviate.io/somebodysysop/32/70_2.png) [@SomebodySysop](https://forum.weaviate.io/u/SomebodySysop)
#### Post date: [March 8, 2024, 12:29am UTC](https://forum.weaviate.io/t/multi-lingual-cosine-similarity-search/1647/1 "2024-03-08T00:29:06Z")

</div>

### Description

I have added some Hebrew texts to my embeddings. I use NearText queries under the Tex2Vec OpenAI transformer.

I am curious if these queries will match similar contexts in the Hebrew texts?

### Server Setup Information

- Weaviate Server Version:
- Deployment Method: WCS
- Multi Node? Number of Running Nodes:
- Client Language and Version: 1.23.10

### Any additional Information

---

<div class="post-metadata">

### Author: ![DudaNogueira](https://yyz1.discourse-cdn.com/flex027/user_avatar/forum.weaviate.io/dudanogueira/32/7846_2.png) [@DudaNogueira](https://forum.weaviate.io/u/DudaNogueira)
#### Post date: [March 8, 2024, 2:30pm UTC](https://forum.weaviate.io/t/multi-lingual-cosine-similarity-search/1647/2 "2024-03-08T14:30:52Z")

</div>

Hi!

It will depend on the LLM inference you use.

If it supports your language, it should work fine as long as Weaviate is aware 🙂

Let me know if this helps!

---

<div class="post-metadata">

### Author: ![SomebodySysop](https://yyz1.discourse-cdn.com/flex027/user_avatar/forum.weaviate.io/somebodysysop/32/70_2.png) [@SomebodySysop](https://forum.weaviate.io/u/SomebodySysop)
#### Post date: [March 8, 2024, 8:06pm UTC](https://forum.weaviate.io/t/multi-lingual-cosine-similarity-search/1647/3 "2024-03-08T20:06:45Z")

</div>

gpt-4 is the model. It supports Hebrew.

> [@DudaNogueira](#):
>
> as long as Weaviate is aware

How is Weaviate made aware?

---

<div class="post-metadata">

### Author: ![DudaNogueira](https://yyz1.discourse-cdn.com/flex027/user_avatar/forum.weaviate.io/dudanogueira/32/7846_2.png) [@DudaNogueira](https://forum.weaviate.io/u/DudaNogueira)
#### Post date: [March 8, 2024, 9:34pm UTC](https://forum.weaviate.io/t/multi-lingual-cosine-similarity-search/1647/4 "2024-03-08T21:34:01Z")

</div>

When you create a collection, you can specify a vectorizer model.

As long as this vectorizer model support multi language, and your class was configured to use it, it should work.

> **[Manage collections | Weaviate - Vector Database](https://weaviate.io/developers/weaviate/manage-data/collections#specify-vectorizer-settings)**
>
> Every object in Weaviate belongs to exactly one collection. Use the examples on this page to manage your collections.

for example:

```auto
import weaviate.classes as wvc

client.collections.create(
    "Article",
    vectorizer_config=wvc.config.Configure.Vectorizer.text2vec_cohere(
        model="embed-multilingual-v2.0",
        vectorize_collection_name=True
    ),
)

```

Cohere has a nice multi language model:

> **[Multilingual Embed Models](https://docs.cohere.com/docs/multilingual-language-models)**
>
> Cohere offers multilingual language models that map text to a semantic vector space, improving search results and enabling use cases such as multilingual semantic search, customer feedback aggregation, and cross-lingual content moderation. The model...

Let me know if this helps 🙂

---

<div class="post-metadata">

### Author: ![SomebodySysop](https://yyz1.discourse-cdn.com/flex027/user_avatar/forum.weaviate.io/somebodysysop/32/70_2.png) [@SomebodySysop](https://forum.weaviate.io/u/SomebodySysop)
#### Post date: [March 8, 2024, 11:46pm UTC](https://forum.weaviate.io/t/multi-lingual-cosine-similarity-search/1647/5 "2024-03-08T23:46:46Z")

</div>

Yes, thanks.

Actually, I want to create a new cluster and use text-embedding-3-large as my embedding model. Do you have a way of finding out if it is multi-lingual? I have asked on the OpenAI developer forum, but so far nobody seems to know.

---

<div class="post-metadata">

### Author: ![SomebodySysop](https://yyz1.discourse-cdn.com/flex027/user_avatar/forum.weaviate.io/somebodysysop/32/70_2.png) [@SomebodySysop](https://forum.weaviate.io/u/SomebodySysop)
#### Post date: [March 9, 2024, 9:24am UTC](https://forum.weaviate.io/t/multi-lingual-cosine-similarity-search/1647/6 "2024-03-09T09:24:13Z")

</div>

It looks like regardless of whether the model is multi-lingual or not, if I add the English translation to the embedding, the cosine similarity search will find it. That’s good to know.

 ![minchat hebrew translated](https://canada1.discourse-cdn.com/flex027/uploads/weaviate/original/2X/7/7ae43bc037f14a3920963821f79c83d1d63b8df4.jpeg)

 ![minchat treatise 18](https://canada1.discourse-cdn.com/flex027/uploads/weaviate/original/2X/1/13062f5ff128ee7afd679ecf1b9e015f75eefc75.jpeg)
