search-qwant
This commit is contained in:
+53
-31
@@ -2,72 +2,94 @@
|
|||||||
|
|
||||||
import sys
|
import sys
|
||||||
import subprocess
|
import subprocess
|
||||||
|
import time
|
||||||
|
import random
|
||||||
|
|
||||||
|
|
||||||
# Vérifie et installe les dépendances si nécessaire
|
|
||||||
def ensure_package(pkg):
|
def ensure_package(pkg):
|
||||||
try:
|
try:
|
||||||
__import__(pkg)
|
__import__(pkg)
|
||||||
except ImportError:
|
except ImportError:
|
||||||
print(f"{pkg} non trouvé, installation...")
|
|
||||||
subprocess.check_call([sys.executable, "-m", "pip", "install", pkg])
|
subprocess.check_call([sys.executable, "-m", "pip", "install", pkg])
|
||||||
|
|
||||||
ensure_package("bs4")
|
|
||||||
ensure_package("requests")
|
for pkg in ("bs4", "requests"):
|
||||||
|
ensure_package(pkg)
|
||||||
|
|
||||||
from bs4 import BeautifulSoup
|
from bs4 import BeautifulSoup
|
||||||
import requests
|
import requests
|
||||||
import argparse
|
import argparse
|
||||||
|
|
||||||
|
|
||||||
def recherche_duckduckgo(query, n=5):
|
def create_session():
|
||||||
url = "https://html.duckduckgo.com/html/"
|
session = requests.Session()
|
||||||
headers = {"User-Agent": "Mozilla/5.0"}
|
session.headers.update({
|
||||||
|
"User-Agent": "Mozilla/5.0"
|
||||||
|
})
|
||||||
|
return session
|
||||||
|
|
||||||
|
|
||||||
|
def fetch(session, method, url, **kwargs):
|
||||||
|
for _ in range(3):
|
||||||
|
try:
|
||||||
|
response = session.request(method, url, timeout=10, **kwargs)
|
||||||
|
if response.status_code == 200:
|
||||||
|
return response
|
||||||
|
time.sleep(5)
|
||||||
|
except requests.RequestException:
|
||||||
|
time.sleep(5)
|
||||||
|
return None
|
||||||
|
|
||||||
|
|
||||||
|
def recherche_duckduckgo(session, query, n):
|
||||||
|
url = "https://html.duckduckgo.com/html/"
|
||||||
|
response = fetch(session, "POST", url, data={"q": query})
|
||||||
|
|
||||||
|
if not response:
|
||||||
|
return []
|
||||||
|
|
||||||
response = requests.post(url, data={"q": query}, headers=headers)
|
|
||||||
soup = BeautifulSoup(response.text, "html.parser")
|
soup = BeautifulSoup(response.text, "html.parser")
|
||||||
|
|
||||||
results = []
|
results = []
|
||||||
for result in soup.find_all("a", class_="result__a", limit=n):
|
for result in soup.select("a.result__a")[:n]:
|
||||||
title = result.get_text()
|
title = result.get_text(strip=True)
|
||||||
link = result.get("href")
|
link = result.get("href")
|
||||||
results.append((title, link))
|
if link:
|
||||||
|
results.append((title, link))
|
||||||
|
|
||||||
|
time.sleep(random.uniform(1.5, 3.5))
|
||||||
return results
|
return results
|
||||||
|
|
||||||
|
|
||||||
def extract_text(url, max_chars=300):
|
def extract_text(session, url, max_chars):
|
||||||
try:
|
response = fetch(session, "GET", url)
|
||||||
headers = {"User-Agent": "Mozilla/5.0"}
|
|
||||||
response = requests.get(url, headers=headers, timeout=5)
|
|
||||||
|
|
||||||
soup = BeautifulSoup(response.text, "html.parser")
|
if not response:
|
||||||
|
return "[Erreur: accès impossible]"
|
||||||
|
|
||||||
# Récupère le texte brut
|
soup = BeautifulSoup(response.text, "html.parser")
|
||||||
text = soup.get_text(separator=" ", strip=True)
|
text = soup.get_text(separator=" ", strip=True)
|
||||||
|
|
||||||
return text[:max_chars] + "..."
|
return (text[:max_chars] + "...") if len(text) > max_chars else text
|
||||||
|
|
||||||
except Exception as e:
|
|
||||||
return f"[Erreur lors de l'accès au site: {e}]"
|
|
||||||
|
|
||||||
|
|
||||||
def main():
|
def main(argc, argv):
|
||||||
parser = argparse.ArgumentParser(description="Recherche + extraction de texte")
|
parser = argparse.ArgumentParser(description="Recherche + extraction de texte")
|
||||||
parser.add_argument("query", type=str, help="Terme de recherche")
|
parser.add_argument("query", type=str)
|
||||||
parser.add_argument("-n", "--number", type=int, default=5, help="Nombre de résultats")
|
parser.add_argument("-n", "--number", type=int, default=5)
|
||||||
parser.add_argument("--chars", type=int, default=1000, help="Nombre de caractères à extraire")
|
parser.add_argument("--chars", type=int, default=1000)
|
||||||
|
|
||||||
args = parser.parse_args()
|
args = parser.parse_args(argv[1:])
|
||||||
|
|
||||||
results = recherche_duckduckgo(args.query, args.number)
|
session = create_session()
|
||||||
|
results = recherche_duckduckgo(session, args.query, args.number)
|
||||||
|
|
||||||
for i, (title, link) in enumerate(results, 1):
|
for i, (title, link) in enumerate(results, 1):
|
||||||
print(f"\n{i}. {title}")
|
print(f"\n{i}. {title}")
|
||||||
print(f"URL: {link}")
|
print(f"URL: {link}")
|
||||||
|
snippet = extract_text(session, link, args.chars)
|
||||||
snippet = extract_text(link, args.chars)
|
|
||||||
print(f"Extrait: {snippet}")
|
print(f"Extrait: {snippet}")
|
||||||
|
|
||||||
|
|
||||||
if __name__ == "__main__":
|
if __name__ == "__main__":
|
||||||
main()
|
main(len(sys.argv), sys.argv)
|
||||||
|
|||||||
Executable
+98
@@ -0,0 +1,98 @@
|
|||||||
|
#!/usr/bin/env python
|
||||||
|
|
||||||
|
import sys
|
||||||
|
import subprocess
|
||||||
|
import time
|
||||||
|
import random
|
||||||
|
|
||||||
|
|
||||||
|
def ensure_package(pkg):
|
||||||
|
try:
|
||||||
|
__import__(pkg)
|
||||||
|
except ImportError:
|
||||||
|
subprocess.check_call([sys.executable, "-m", "pip", "install", pkg])
|
||||||
|
|
||||||
|
|
||||||
|
ensure_package("requests")
|
||||||
|
|
||||||
|
import requests
|
||||||
|
import argparse
|
||||||
|
|
||||||
|
|
||||||
|
def create_session():
|
||||||
|
session = requests.Session()
|
||||||
|
session.headers.update({
|
||||||
|
"User-Agent": "Mozilla/5.0"
|
||||||
|
})
|
||||||
|
return session
|
||||||
|
|
||||||
|
|
||||||
|
def fetch(session, url, params=None, retries=2, timeout=5):
|
||||||
|
for _ in range(retries):
|
||||||
|
try:
|
||||||
|
r = session.get(url, params=params, timeout=timeout)
|
||||||
|
if r.status_code == 200:
|
||||||
|
return r.json()
|
||||||
|
time.sleep(random.uniform(1, 2))
|
||||||
|
except requests.RequestException:
|
||||||
|
time.sleep(random.uniform(1, 2))
|
||||||
|
return None
|
||||||
|
|
||||||
|
|
||||||
|
def recherche_qwant(session, query, n):
|
||||||
|
url = "https://api.qwant.com/v3/search/web"
|
||||||
|
params = {
|
||||||
|
"q": query,
|
||||||
|
"count": n,
|
||||||
|
"offset": 0,
|
||||||
|
"t": "web",
|
||||||
|
"safesearch": 0,
|
||||||
|
"locale": "en_US"
|
||||||
|
}
|
||||||
|
|
||||||
|
data = fetch(session, url, params=params)
|
||||||
|
if not data:
|
||||||
|
return []
|
||||||
|
|
||||||
|
results = []
|
||||||
|
items = data.get("data", {}).get("result", {}).get("items", [])
|
||||||
|
|
||||||
|
for item in items[:n]:
|
||||||
|
title = item.get("title")
|
||||||
|
link = item.get("url")
|
||||||
|
if title and link:
|
||||||
|
results.append((title, link))
|
||||||
|
|
||||||
|
time.sleep(random.uniform(1, 2))
|
||||||
|
return results
|
||||||
|
|
||||||
|
|
||||||
|
def extract_text(session, url, max_chars):
|
||||||
|
try:
|
||||||
|
r = session.get(url, timeout=5)
|
||||||
|
text = r.text
|
||||||
|
return (text[:max_chars] + "...") if len(text) > max_chars else text
|
||||||
|
except Exception as e:
|
||||||
|
return f"[Erreur: {e}]"
|
||||||
|
|
||||||
|
|
||||||
|
def main(argc, argv):
|
||||||
|
parser = argparse.ArgumentParser()
|
||||||
|
parser.add_argument("query", type=str)
|
||||||
|
parser.add_argument("-n", "--number", type=int, default=5)
|
||||||
|
parser.add_argument("--chars", type=int, default=1000)
|
||||||
|
|
||||||
|
args = parser.parse_args(argv[1:])
|
||||||
|
|
||||||
|
session = create_session()
|
||||||
|
results = recherche_qwant(session, args.query, args.number)
|
||||||
|
|
||||||
|
for i, (title, link) in enumerate(results, 1):
|
||||||
|
print(f"\n{i}. {title}")
|
||||||
|
print(f"URL: {link}")
|
||||||
|
snippet = extract_text(session, link, args.chars)
|
||||||
|
print(f"Extrait: {snippet}")
|
||||||
|
|
||||||
|
|
||||||
|
if __name__ == "__main__":
|
||||||
|
main(len(sys.argv), sys.argv)
|
||||||
Reference in New Issue
Block a user